@misc{indiciaebe9c52c94494, title = {iLLaVA: An Image is Worth Fewer Than 1/3 Input Tokens in Large Multimodal Models}, author = {Lianyu Hu and Liqing Gao and Fanhua Shang and Liang Wan and Wei Feng}, year = {2026}, url = {https://arxiv.org/abs/2412.06263}, note = {Source identifier: 2412.06263} }