@misc{indiciaed269f3cf2e17, title = {Sound-VECaps: Improving Audio Generation with Visual Enhanced Captions}, author = {Yi Yuan and Dongya Jia and Xiaobin Zhuang and Yuanzhe Chen and Zhengxi Liu and Zhuo Chen and Yuping Wang and Yuxuan Wang and Xubo Liu and Xiyuan Kang and Mark D. Plumbley and Wenwu Wang}, year = {2025}, url = {https://arxiv.org/abs/2407.04416}, note = {Source identifier: 2407.04416} }