@misc{indiciae70815e9fbb1e, title = {VTool-R1: VLMs Learn to Think with Images via Reinforcement Learning on Multimodal Tool Use}, author = {Mingyuan Wu and Jingcheng Yang and Jize Jiang and Meitang Li and Kaizhuo Yan and Hanchao Yu and Minjia Zhang and Chengxiang Zhai and Klara Nahrstedt}, year = {2026}, url = {https://arxiv.org/abs/2505.19255}, note = {Source identifier: 2505.19255} }