@misc{indiciaeb71245c0a697, title = {Unsupervised Vision-and-Language Pre-training via Retrieval-based Multi-Granular Alignment}, author = {Mingyang Zhou and Licheng Yu and Amanpreet Singh and Mengjiao Wang and Zhou Yu and Ning Zhang}, year = {2022}, url = {https://arxiv.org/abs/2203.00242}, note = {Source identifier: 2203.00242} }