@misc{indiciae3489b5ea58a2, title = {Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation}, author = {Zhiheng Liu and Weiming Ren and Xiaoke Huang and Shoufa Chen and Tianhong Li and Mengzhao Chen and Yatai Ji and Sen He and Jonas Schult and Belinda Zeng and Tao Xiang and Wenhu Chen and Ping Luo and Luke Zettlemoyer and Yuren Cong}, year = {2026}, url = {https://arxiv.org/abs/2604.24763}, note = {Source identifier: 2604.24763} }