@misc{indiciaecabdd815635d, title = {Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding}, author = {Hang Zhang and Xin Li and Lidong Bing}, year = {2023}, url = {https://arxiv.org/abs/2306.02858}, note = {Source identifier: 2306.02858} }