@misc{indiciae887bef5bb02f, title = {MAMO: Masked Multimodal Modeling for Fine-Grained Vision-Language Representation Learning}, author = {Zijia Zhao and Longteng Guo and Xingjian He and Shuai Shao and Zehuan Yuan and Jing Liu}, year = {2023}, doi = {10.1145/3539618.3591721}, url = {https://arxiv.org/abs/2210.04183}, note = {Source identifier: 2210.04183} }