@misc{indiciae1e492baf5b96, title = {DLER: Doing Length pEnalty Right - Incentivizing More Intelligence per Token via Reinforcement Learning}, author = {Shih-Yang Liu and Xin Dong and Ximing Lu and Shizhe Diao and Mingjie Liu and Min-Hung Chen and Hongxu Yin and Yu-Chiang Frank Wang and Kwang-Ting Cheng and Yejin Choi and Jan Kautz and Pavlo Molchanov}, year = {2025}, url = {https://arxiv.org/abs/2510.15110}, note = {Source identifier: 2510.15110} }