@misc{indiciae1a8cf5d653f0, title = {TRIPS: Efficient Vision-and-Language Pre-training with Text-Relevant Image Patch Selection}, author = {Chaoya Jiang and Haiyang Xu and Chenliang Li and Miang Yan and Wei Ye and Shikun Zhang and Bin Bi and Songfang Huang}, year = {2025}, url = {https://arxiv.org/abs/2305.04474}, note = {Source identifier: 2305.04474} }