@misc{indiciae49bc07d7deab, title = {COPA: Efficient Vision-Language Pre-training Through Collaborative Object- and Patch-Text Alignment}, author = {Chaoya Jiang and Haiyang Xu and Wei Ye and Qinghao Ye and Chenliang Li and Ming Yan and Bin Bi and Shikun Zhang and Ji Zhang and Fei Huang}, year = {2024}, url = {https://arxiv.org/abs/2308.03475}, note = {Source identifier: 2308.03475} }