@misc{indiciaef1c390102dd0, title = {VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs}, author = {Zesen Cheng and Sicong Leng and Hang Zhang and Yifei Xin and Xin Li and Guanzheng Chen and Yongxin Zhu and Wenqi Zhang and Ziyang Luo and Deli Zhao and Lidong Bing}, year = {2024}, url = {https://arxiv.org/abs/2406.07476}, note = {Source identifier: 2406.07476} }