@misc{indiciaeacd458f2c28a, title = {CogVLM2: Visual Language Models for Image and Video Understanding}, author = {Wenyi Hong and Weihan Wang and Ming Ding and Wenmeng Yu and Qingsong Lv and Yan Wang and Yean Cheng and Shiyu Huang and Junhui Ji and Zhao Xue and Lei Zhao and Zhuoyi Yang and Xiaotao Gu and Xiaohan Zhang and Guanyu Feng and Da Yin and Zihan Wang and Ji Qi and Xixuan Song and Peng Zhang and Debing Liu and Bin Xu and Juanzi Li and Yuxiao Dong and Jie Tang}, year = {2024}, url = {https://arxiv.org/abs/2408.16500}, note = {Source identifier: 2408.16500} }