TY - RPRT TI - S-GRPO: Early Exit via Reinforcement Learning in Reasoning Models AU - Muzhi Dai AU - Chenxu Yang AU - Qingyi Si PY - 2025 UR - https://arxiv.org/abs/2505.07686 ID - 2505.07686 ER -