TY - RPRT TI - Vision Inference Former: Sustaining Visual Consistency in Multimodal Large Language Models AU - Xinpeng Dong AU - Min Zhang AU - Kairong Han AU - Xu Tan AU - Fei Wu AU - Kun Kuang PY - 2026 UR - https://arxiv.org/abs/2605.18160 ID - 2605.18160 ER -