@misc{indiciaec82e61f642cb, title = {Visual Generation Unlocks Human-Like Reasoning through Multimodal World Models}, author = {Jialong Wu and Xiaoying Zhang and Hongyi Yuan and Xiangcheng Zhang and Tianhao Huang and Changjing He and Chaoyi Deng and Renrui Zhang and Youbin Wu and Mingsheng Long}, year = {2026}, url = {https://arxiv.org/abs/2601.19834}, note = {Source identifier: 2601.19834} }