TY - RPRT TI - QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation AU - Yue Zhao AU - Fuzhao Xue AU - Scott Reed AU - Linxi Fan AU - Yuke Zhu AU - Jan Kautz AU - Zhiding Yu AU - Philipp Krähenbühl AU - De-An Huang PY - 2025 UR - https://arxiv.org/abs/2502.05178 ID - 2502.05178 ER -