@misc{indiciae0c2ab7df6af3, title = {VLM2Vec: Training Vision-Language Models for Massive Multimodal Embedding Tasks}, author = {Ziyan Jiang and Rui Meng and Xinyi Yang and Semih Yavuz and Yingbo Zhou and Wenhu Chen}, year = {2025}, url = {https://arxiv.org/abs/2410.05160}, note = {Source identifier: 2410.05160} }