@misc{indiciae08adfb5325c6, title = {Small Vision-Language Models are Smart Compressors for Long Video Understanding}, author = {Junjie Fei and Jun Chen and Zechun Liu and Yunyang Xiong and Chong Zhou and Wei Wen and Junlin Han and Mingchen Zhuge and Saksham Suri and Qi Qian and Shuming Liu and Lemeng Wu and Raghuraman Krishnamoorthi and Vikas Chandra and Mohamed Elhoseiny and Chenchen Zhu}, year = {2026}, url = {https://arxiv.org/abs/2604.08120}, note = {Source identifier: 2604.08120} }