@misc{indiciae9e58c1f0058c, title = {Tango: Taming Visual Signals for Efficient Video Large Language Models}, author = {Shukang Yin and Sirui Zhao and Hanchao Wang and Baozhi Jia and Xianquan Wang and Chaoyou Fu and Enhong Chen}, year = {2026}, url = {https://arxiv.org/abs/2604.09547}, note = {Source identifier: 2604.09547} }