TY - RPRT TI - Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning AU - Violet Xiang AU - Chase Blagden AU - Rafael Rafailov AU - Nathan Lile AU - Sang Truong AU - Chelsea Finn AU - Nick Haber PY - 2025 UR - https://arxiv.org/abs/2506.05256 ID - 2506.05256 ER -