TY - RPRT TI - ViSTA: Vision and Scene Text Aggregation for Cross-Modal Retrieval AU - Mengjun Cheng AU - Yipeng Sun AU - Longchao Wang AU - Xiongwei Zhu AU - Kun Yao AU - Jie Chen AU - Guoli Song AU - Junyu Han AU - Jingtuo Liu AU - Errui Ding AU - Jingdong Wang PY - 2022 UR - https://arxiv.org/abs/2203.16778 ID - 2203.16778 ER -