@misc{indiciaef7fc47a87a92, title = {SRPO: Enhancing Multimodal LLM Reasoning via Reflection-Aware Reinforcement Learning}, author = {Zhongwei Wan and Zhihao Dou and Che Liu and Yu Zhang and Dongfei Cui and Qinjian Zhao and Hui Shen and Jing Xiong and Yi Xin and Yifan Jiang and Chaofan Tao and Yangfan He and Mi Zhang and Shen Yan}, year = {2025}, url = {https://arxiv.org/abs/2506.01713}, note = {Source identifier: 2506.01713} }