@misc{indiciaef2dc9ffec65c, title = {E2E-VLP: End-to-End Vision-Language Pre-training Enhanced by Visual Learning}, author = {Haiyang Xu and Ming Yan and Chenliang Li and Bin Bi and Songfang Huang and Wenming Xiao and Fei Huang}, year = {2021}, url = {https://arxiv.org/abs/2106.01804}, note = {Source identifier: 2106.01804} }