@misc{indiciae1e98d5a3a2fe, title = {ViLTA: Enhancing Vision-Language Pre-training through Textual Augmentation}, author = {Weihan Wang and Zhen Yang and Bin Xu and Juanzi Li and Yankui Sun}, year = {2023}, url = {https://arxiv.org/abs/2308.16689}, note = {Source identifier: 2308.16689} }