TY - RPRT TI - M-GRPO: Stabilizing Self-Supervised Reinforcement Learning for Large Language Models with Momentum-Anchored Policy Optimization AU - Bizhe Bai AU - Hongming Wu AU - Peng Ye AU - Tao Chen PY - 2025 UR - https://arxiv.org/abs/2512.13070 ID - 2512.13070 ER -