@misc{indiciaef1aa501e2a10, title = {How Many Visual Tokens Do Multimodal Language Models Need? Scaling Visual Token Pruning with F\textasciicircum{}3A}, author = {YiJie Huang and Yiqun Zhang and Zhuoyue Jia and Xiaocui Yang and Junzhao Huang and Zihan Wang and Shi Feng and Daling Wang and Yifei Zhang and Yongkang Liu}, year = {2026}, url = {https://arxiv.org/abs/2605.16359}, note = {Source identifier: 2605.16359} }