@misc{indiciae4cc75a288ca1, title = {AV-Odyssey Bench: Can Your Multimodal LLMs Really Understand Audio-Visual Information?}, author = {Kaixiong Gong and Kaituo Feng and Bohao Li and Yibing Wang and Mofan Cheng and Shijia Yang and Jiaming Han and Benyou Wang and Yutong Bai and Zhuoran Yang and Xiangyu Yue}, year = {2024}, url = {https://arxiv.org/abs/2412.02611}, note = {Source identifier: 2412.02611} }