@misc{indiciae68c32964bf01, title = {VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding}, author = {Boqiang Zhang and Kehan Li and Zesen Cheng and Zhiqiang Hu and Yuqian Yuan and Guanzheng Chen and Sicong Leng and Yuming Jiang and Hang Zhang and Xin Li and Peng Jin and Wenqi Zhang and Fan Wang and Lidong Bing and Deli Zhao}, year = {2025}, url = {https://arxiv.org/abs/2501.13106}, note = {Source identifier: 2501.13106} }