@misc{indiciaeebeced948913, title = {InternVideo2: Scaling Foundation Models for Multimodal Video Understanding}, author = {Yi Wang and Kunchang Li and Xinhao Li and Jiashuo Yu and Yinan He and Chenting Wang and Guo Chen and Baoqi Pei and Ziang Yan and Rongkun Zheng and Jilan Xu and Zun Wang and Yansong Shi and Tianxiang Jiang and Songze Li and Hongjie Zhang and Yifei Huang and Yu Qiao and Yali Wang and Limin Wang}, year = {2024}, url = {https://arxiv.org/abs/2403.15377}, note = {Source identifier: 2403.15377} }