@misc{indiciae2cbaef22c66c, title = {Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models}, author = {Zhi Zeng and Cheng Zhang and Zesheng Yang and Rendong Pi and Jiaying Wu and Di Zhang and Zihan Ma and Guodong Li and Zhou Yang and Yu Xiang and Yifei Zheng and Minnan Luo}, year = {2026}, url = {https://arxiv.org/abs/2608.09435}, note = {Source identifier: 2608.09435} }