TY - RPRT TI - DLER: Doing Length pEnalty Right - Incentivizing More Intelligence per Token via Reinforcement Learning AU - Shih-Yang Liu AU - Xin Dong AU - Ximing Lu AU - Shizhe Diao AU - Mingjie Liu AU - Min-Hung Chen AU - Hongxu Yin AU - Yu-Chiang Frank Wang AU - Kwang-Ting Cheng AU - Yejin Choi AU - Jan Kautz AU - Pavlo Molchanov PY - 2025 UR - https://arxiv.org/abs/2510.15110 ID - 2510.15110 ER -