@misc{indiciae27394105845f, title = {InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation}, author = {Yi Wang and Yinan He and Yizhuo Li and Kunchang Li and Jiashuo Yu and Xin Ma and Xinhao Li and Guo Chen and Xinyuan Chen and Yaohui Wang and Conghui He and Ping Luo and Ziwei Liu and Yali Wang and Limin Wang and Yu Qiao}, year = {2024}, url = {https://arxiv.org/abs/2307.06942}, note = {Source identifier: 2307.06942} }