TY - RPRT TI - MC-GRPO: Median-Centered Group Relative Policy Optimization for Small-Rollout Reinforcement Learning AU - Youngeun Kim PY - 2026 UR - https://arxiv.org/abs/2601.22582 ID - 2601.22582 ER -