TY - RPRT TI - Investigating and Enhancing Vision-Audio Capability in Omnimodal Large Language Models AU - Rui Hu AU - Delai Qiu AU - Shuyu Wei AU - Jiaming Zhang AU - Yining Wang AU - Shengping Liu AU - Jitao Sang PY - 2025 DO - 10.18653/v1/2025.findings-acl.389 UR - https://arxiv.org/abs/2503.00059 ID - 2503.00059 ER -