@misc{indiciaee06b91087512, title = {ROSITA: Enhancing Vision-and-Language Semantic Alignments via Cross- and Intra-modal Knowledge Integration}, author = {Yuhao Cui and Zhou Yu and Chunqi Wang and Zhongzhou Zhao and Ji Zhang and Meng Wang and Jun Yu}, year = {2021}, url = {https://arxiv.org/abs/2108.07073}, note = {Source identifier: 2108.07073} }