@misc{indiciae2c5af26be5dd, title = {AVOC: Enhancing Hour-Level Audio-Video Understanding in Omni-Modal LLMs via Retrieval-Inspired Token Compression}, author = {Yijing Chen and Wenhui Tan and Xiaoyi Yu and Yuyue Wang and Xin Cheng and Kaisi Guan and Hao Jiang and Xiangyang Li and Guojie Zhu and Ruihua Song}, year = {2026}, url = {https://arxiv.org/abs/2606.24286}, note = {Source identifier: 2606.24286} }