TY - RPRT TI - Stable Reinforcement Learning for Efficient Reasoning AU - Muzhi Dai AU - Shixuan Liu AU - Qingyi Si PY - 2025 UR - https://arxiv.org/abs/2505.18086 ID - 2505.18086 ER -