@misc{indiciae99ff1dfc9303, title = {Investigating and Enhancing Vision-Audio Capability in Omnimodal Large Language Models}, author = {Rui Hu and Delai Qiu and Shuyu Wei and Jiaming Zhang and Yining Wang and Shengping Liu and Jitao Sang}, year = {2025}, doi = {10.18653/v1/2025.findings-acl.389}, url = {https://arxiv.org/abs/2503.00059}, note = {Source identifier: 2503.00059} }