@misc{indiciaeb1a97b858d1c, title = {Semantics-enhanced Cross-modal Masked Image Modeling for Vision-Language Pre-training}, author = {Haowei Liu and Yaya Shi and Haiyang Xu and Chunfeng Yuan and Qinghao Ye and Chenliang Li and Ming Yan and Ji Zhang and Fei Huang and Bing Li and Weiming Hu}, year = {2024}, url = {https://arxiv.org/abs/2403.00249}, note = {Source identifier: 2403.00249} }