@misc{indiciae12763cd16d9d, title = {Coarse-to-Fine Vision-Language Pre-training with Fusion in the Backbone}, author = {Zi-Yi Dou and Aishwarya Kamath and Zhe Gan and Pengchuan Zhang and Jianfeng Wang and Linjie Li and Zicheng Liu and Ce Liu and Yann LeCun and Nanyun Peng and Jianfeng Gao and Lijuan Wang}, year = {2022}, url = {https://arxiv.org/abs/2206.07643}, note = {Source identifier: 2206.07643} }