@misc{indiciae2481093b3d26, title = {Vision as Unified Multimodal Generation}, author = {Xiaoyang Han and Jianhua Li and Kewang Deng and Zukai Chen and Xuanke Shi and Sihan Wang and Boxuan Li and Linyan Wang and Siyi Xie and Xin You and Jinsheng Quan and Zhongang Cai and Haiwen Diao and Ziwei Liu and Lei Yang and Dahua Lin and Quan Wang}, year = {2026}, url = {https://arxiv.org/abs/2607.06560}, note = {Source identifier: 2607.06560} }