@misc{indiciae0d9f657cd463, title = {Revisit Large-Scale Image-Caption Data in Pre-training Multimodal Foundation Models}, author = {Zhengfeng Lai and Vasileios Saveris and Chen Chen and Hong-You Chen and Haotian Zhang and Bowen Zhang and Juan Lao Tebar and Wenze Hu and Zhe Gan and Peter Grasch and Meng Cao and Yinfei Yang}, year = {2024}, url = {https://arxiv.org/abs/2410.02740}, note = {Source identifier: 2410.02740} }