@misc{indiciae82cd2d3f028e, title = {Watch and Listen: Understanding Audio-Visual-Speech Moments with Multimodal LLM}, author = {Zinuo Li and Xian Zhang and Yongxin Guo and Mohammed Bennamoun and Farid Boussaid and Girish Dwivedi and Luqi Gong and Qiuhong Ke}, year = {2026}, url = {https://arxiv.org/abs/2505.18110}, note = {Source identifier: 2505.18110} }