TY - RPRT TI - VAST: A Vision-Audio-Subtitle-Text Omni-Modality Foundation Model and Dataset AU - Sihan Chen AU - Handong Li AU - Qunbo Wang AU - Zijia Zhao AU - Mingzhen Sun AU - Xinxin Zhu AU - Jing Liu PY - 2023 UR - https://arxiv.org/abs/2305.18500 ID - 2305.18500 ER -