@misc{indiciae99074b150a4f, title = {ViTCoT: Video-Text Interleaved Chain-of-Thought for Boosting Video Understanding in Large Language Models}, author = {Yongheng Zhang and Xu Liu and Ruihan Tao and Qiguang Chen and Hao Fei and Wanxiang Che and Libo Qin}, year = {2025}, url = {https://arxiv.org/abs/2507.09876}, note = {Source identifier: 2507.09876} }