@misc{indiciae7917dfcfaa7f, title = {VideoCap-R1: Enhancing MLLMs for Video Captioning via Structured Thinking}, author = {Desen Meng and Rui Huang and Zhilin Dai and Xinhao Li and Yifan Xu and Jun Zhang and Zhenpeng Huang and Meng Zhang and Lingshu Zhang and Yi Liu and Limin Wang}, year = {2025}, url = {https://arxiv.org/abs/2506.01725}, note = {Source identifier: 2506.01725} }