TY - RPRT TI - CAT: Enhancing Multimodal Large Language Model to Answer Questions in Dynamic Audio-Visual Scenarios AU - Qilang Ye AU - Zitong Yu AU - Rui Shao AU - Xinyu Xie AU - Philip Torr AU - Xiaochun Cao PY - 2024 UR - https://arxiv.org/abs/2403.04640 ID - 2403.04640 ER -