@misc{indiciaeca69d196c301, title = {video-SALMONN: Speech-Enhanced Audio-Visual Large Language Models}, author = {Guangzhi Sun and Wenyi Yu and Changli Tang and Xianzhao Chen and Tian Tan and Wei Li and Lu Lu and Zejun Ma and Yuxuan Wang and Chao Zhang}, year = {2024}, url = {https://arxiv.org/abs/2406.15704}, note = {Source identifier: 2406.15704} }