@misc{indiciae370b60336ddd, title = {ViSTA: Vision and Scene Text Aggregation for Cross-Modal Retrieval}, author = {Mengjun Cheng and Yipeng Sun and Longchao Wang and Xiongwei Zhu and Kun Yao and Jie Chen and Guoli Song and Junyu Han and Jingtuo Liu and Errui Ding and Jingdong Wang}, year = {2022}, url = {https://arxiv.org/abs/2203.16778}, note = {Source identifier: 2203.16778} }