TY - RPRT TI - Beyond Penalizing Mistakes: Stabilizing Efficiency Training in Large Reasoning Models via Adaptive Correct-Only Rewards AU - Jungseob Lee AU - Seungyoon Lee AU - Seongtae Hong AU - Minhyuk Kim AU - Chanjun Park AU - Heuiseok Lim PY - 2026 UR - https://arxiv.org/abs/2606.22716 ID - 2606.22716 ER -