@misc{indiciae2a7e41e1b7bb, title = {Training Vision-Language Transformers from Captions}, author = {Liangke Gui and Yingshan Chang and Qiuyuan Huang and Subhojit Som and Alex Hauptmann and Jianfeng Gao and Yonatan Bisk}, year = {2023}, url = {https://arxiv.org/abs/2205.09256}, note = {Source identifier: 2205.09256} }