TY - RPRT TI - SRPO: Enhancing Multimodal LLM Reasoning via Reflection-Aware Reinforcement Learning AU - Zhongwei Wan AU - Zhihao Dou AU - Che Liu AU - Yu Zhang AU - Dongfei Cui AU - Qinjian Zhao AU - Hui Shen AU - Jing Xiong AU - Yi Xin AU - Yifan Jiang AU - Chaofan Tao AU - Yangfan He AU - Mi Zhang AU - Shen Yan PY - 2025 UR - https://arxiv.org/abs/2506.01713 ID - 2506.01713 ER -