@misc{indiciae3c2e2224af36, title = {InterBERT: Vision-and-Language Interaction for Multi-modal Pretraining}, author = {Junyang Lin and An Yang and Yichang Zhang and Jie Liu and Jingren Zhou and Hongxia Yang}, year = {2021}, url = {https://arxiv.org/abs/2003.13198}, note = {Source identifier: 2003.13198} }