@misc{indiciaed04c72e21ea5, title = {From Visuals to Vocabulary: Establishing Equivalence Between Image and Text Token Through Autoregressive Pre-training in MLLMs}, author = {Mingxiao Li and Fang Qu and Zhanpeng Chen and Na Su and Zhizhou Zhong and Ziyang Chen and Nan Du and Xiaolong Li}, year = {2025}, url = {https://arxiv.org/abs/2502.09093}, note = {Source identifier: 2502.09093} }