@misc{indiciae0bd2527c5798, title = {Analyzing Diffusion and Autoregressive Vision Language Models in Multimodal Embedding Space}, author = {Zihang Wang and Siyue Zhang and Yilun Zhao and Jingyi Yang and Tingyu Song and Anh Tuan Luu and Chen Zhao}, year = {2026}, url = {https://arxiv.org/abs/2602.06056}, note = {Source identifier: 2602.06056} }