TY - RPRT TI - R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization AU - Jingyi Zhang AU - Jiaxing Huang AU - Huanjin Yao AU - Shunyu Liu AU - Xikun Zhang AU - Shijian Lu AU - Dacheng Tao PY - 2025 UR - https://arxiv.org/abs/2503.12937 ID - 2503.12937 ER -