@misc{indiciae18d0090d2f1b, title = {Vision as a Dialect: Unifying Visual Understanding and Generation via Text-Aligned Representations}, author = {Jiaming Han and Hao Chen and Yang Zhao and Hanyu Wang and Qi Zhao and Ziyan Yang and Hao He and Xiangyu Yue and Lu Jiang}, year = {2025}, url = {https://arxiv.org/abs/2506.18898}, note = {Source identifier: 2506.18898} }