@misc{indiciae7a72bd66e9b2, title = {Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding}, author = {Yan Shu and Zheng Liu and Peitian Zhang and Minghao Qin and Junjie Zhou and Zhengyang Liang and Tiejun Huang and Bo Zhao}, year = {2024}, url = {https://arxiv.org/abs/2409.14485}, note = {Source identifier: 2409.14485} }