@misc{indiciae7c145c6ebf9a, title = {VAST: A Vision-Audio-Subtitle-Text Omni-Modality Foundation Model and Dataset}, author = {Sihan Chen and Handong Li and Qunbo Wang and Zijia Zhao and Mingzhen Sun and Xinxin Zhu and Jing Liu}, year = {2023}, url = {https://arxiv.org/abs/2305.18500}, note = {Source identifier: 2305.18500} }