@misc{indiciae929805bc4137, title = {Efficient Vision-and-Language Pre-training with Text-Relevant Image Patch Selection}, author = {Wei Ye and Chaoya Jiang and Haiyang Xu and Chenhao Ye and Chenliang Li and Ming Yan and Shikun Zhang and Songhang Huang and Fei Huang}, year = {2024}, url = {https://arxiv.org/abs/2403.07883}, note = {Source identifier: 2403.07883} }