@misc{indiciae1f7a1fa21ef4, title = {R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization}, author = {Jingyi Zhang and Jiaxing Huang and Huanjin Yao and Shunyu Liu and Xikun Zhang and Shijian Lu and Dacheng Tao}, year = {2025}, url = {https://arxiv.org/abs/2503.12937}, note = {Source identifier: 2503.12937} }