@misc{indiciae3b626d6dbef3, title = {VisionSelector: End-to-End Learnable Visual Token Compression for Efficient Multimodal LLMs}, author = {Jiaying Zhu and Yurui Zhu and Xin Lu and Wenrui Yan and Dong Li and Kunlin Liu and Xueyang Fu and Zheng-Jun Zha}, year = {2026}, url = {https://arxiv.org/abs/2510.16598}, note = {Source identifier: 2510.16598} }