@misc{indiciaeb52d9d1ed7ec, title = {Thinking With Bounding Boxes: Enhancing Spatio-Temporal Video Grounding via Reinforcement Fine-Tuning}, author = {Xin Gu and Haoji Zhang and Qihang Fan and Jingxuan Niu and Zhipeng Zhang and Libo Zhang and Guang Chen and Fan Chen and Longyin Wen and Sijie Zhu}, year = {2025}, url = {https://arxiv.org/abs/2511.21375}, note = {Source identifier: 2511.21375} }