@misc{indiciae0c8810a242c8, title = {Seeing the Forest and the Trees: Query-Aware Tokenizer for Long-Video Multimodal Language Models}, author = {Siyou Li and Huanan Wu and Juexi Shao and Yinghao Ma and Yujian Gan and Yihao Luo and Yuwei Wang and Dong Nie and Lu Wang and Wenqing Wu and Le Zhang and Massimo Poesio and Juntao Yu}, year = {2026}, url = {https://arxiv.org/abs/2511.11910}, note = {Source identifier: 2511.11910} }