@misc{indiciaea16cb044c11d, title = {AVSCap: Orchestrating Audio-Visual Synergy for Omni-modal Video Captioning}, author = {Yanghai Wang and Jiahao Wang and Jiafu Tang and Yuanxing Zhang and Zhe Cao and Hanyan Bian and Zijie Zhang and Weiliang Luo and Zhiyu Pan and Zixuan Dong and Jiaheng Liu and Zhaoxiang Zhang}, year = {2026}, url = {https://arxiv.org/abs/2607.12820}, note = {Source identifier: 2607.12820} }