@misc{indiciaedb601a99515e, title = {LaViT: Aligning Latent Visual Thoughts for Multi-modal Reasoning}, author = {Linquan Wu and Tianxiang Jiang and Yifei Dong and Haoyu Yang and Fengji Zhang and Shichaang Meng and Ai Xuan and Linqi Song and Jacky Keung}, year = {2026}, url = {https://arxiv.org/abs/2601.10129}, note = {Source identifier: 2601.10129} }