@misc{indiciaefc78dc62afd7, title = {TokLIP: Marry Visual Tokens to CLIP for Multimodal Comprehension and Generation}, author = {Haokun Lin and Teng Wang and Yixiao Ge and Yuying Ge and Zhichao Lu and Ying Wei and Qingfu Zhang and Zhenan Sun and Ying Shan}, year = {2025}, url = {https://arxiv.org/abs/2505.05422}, note = {Source identifier: 2505.05422} }