@misc{indiciae2be77a040f0b, title = {MVPTR: Multi-Level Semantic Alignment for Vision-Language Pre-Training via Multi-Stage Learning}, author = {Zejun Li and Zhihao Fan and Huaixiao Tou and Jingjing Chen and Zhongyu Wei and Xuanjing Huang}, year = {2022}, url = {https://arxiv.org/abs/2201.12596}, note = {Source identifier: 2201.12596} }