@misc{indiciaef95daa2cf32e, title = {Learning Compact Video Representations for Efficient Long-form Video Understanding in Large Multimodal Models}, author = {Yuxiao Chen and Jue Wang and Zhikang Zhang and Jingru Yi and Xu Zhang and Yang Zou and Zhaowei Cai and Jianbo Yuan and Xinyu Li and Hao Yang and Davide Modolo}, year = {2026}, url = {https://arxiv.org/abs/2602.17869}, note = {Source identifier: 2602.17869} }