TY - RPRT TI - Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models AU - Zhi Zeng AU - Cheng Zhang AU - Zesheng Yang AU - Rendong Pi AU - Jiaying Wu AU - Di Zhang AU - Zihan Ma AU - Guodong Li AU - Zhou Yang AU - Yu Xiang AU - Yifei Zheng AU - Minnan Luo PY - 2026 UR - https://arxiv.org/abs/2608.09435 ID - 2608.09435 ER -