@misc{indiciaec89ccd3d1212, title = {Vision Inference Former: Sustaining Visual Consistency in Multimodal Large Language Models}, author = {Xinpeng Dong and Min Zhang and Kairong Han and Xu Tan and Fei Wu and Kun Kuang}, year = {2026}, url = {https://arxiv.org/abs/2605.18160}, note = {Source identifier: 2605.18160} }