TY - RPRT TI - Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training AU - Mingjie Liu AU - Shizhe Diao AU - Jian Hu AU - Ximing Lu AU - Xin Dong AU - Hao Zhang AU - Alexander Bukharin AU - Shaokun Zhang AU - Jiaqi Zeng AU - Makesh Narsimhan Sreedhar AU - Gerald Shen AU - David Mosallanezhad AU - Di Zhang AU - Jonas Yang AU - June Yang AU - Oleksii Kuchaiev AU - Guilin Liu AU - Zhiding Yu AU - Pavlo Molchanov AU - Yejin Choi AU - Jan Kautz AU - Yi Dong PY - 2025 UR - https://arxiv.org/abs/2507.12507 ID - 2507.12507 ER -