@misc{indiciae0f34a73b3243, title = {Grid-VLP: Revisiting Grid Features for Vision-Language Pre-training}, author = {Ming Yan and Haiyang Xu and Chenliang Li and Bin Bi and Junfeng Tian and Min Gui and Wei Wang}, year = {2021}, url = {https://arxiv.org/abs/2108.09479}, note = {Source identifier: 2108.09479} }