@misc{indiciae1b0f3596c201, title = {Mono-InternVL: Pushing the Boundaries of Monolithic Multimodal Large Language Models with Endogenous Visual Pre-training}, author = {Gen Luo and Xue Yang and Wenhan Dou and Zhaokai Wang and Jiawen Liu and Jifeng Dai and Yu Qiao and Xizhou Zhu}, year = {2025}, url = {https://arxiv.org/abs/2410.08202}, note = {Source identifier: 2410.08202} }