@misc{indiciaed97b02888184, title = {VinVL: Revisiting Visual Representations in Vision-Language Models}, author = {Pengchuan Zhang and Xiujun Li and Xiaowei Hu and Jianwei Yang and Lei Zhang and Lijuan Wang and Yejin Choi and Jianfeng Gao}, year = {2021}, url = {https://arxiv.org/abs/2101.00529}, note = {Source identifier: 2101.00529} }