@misc{indiciae77195f06d8cc, title = {MLIM: Vision-and-Language Model Pre-training with Masked Language and Image Modeling}, author = {Tarik Arici and Mehmet Saygin Seyfioglu and Tal Neiman and Yi Xu and Son Train and Trishul Chilimbi and Belinda Zeng and Ismail Tutar}, year = {2021}, url = {https://arxiv.org/abs/2109.12178}, note = {Source identifier: 2109.12178} }