TY - RPRT TI - Stabilizing Reinforcement Learning with LLMs: Formulation and Practices AU - Chujie Zheng AU - Kai Dang AU - Bowen Yu AU - Mingze Li AU - Huiqiang Jiang AU - Junrong Lin AU - Yuqiong Liu AU - Hao Lin AU - Chencan Wu AU - Feng Hu AU - An Yang AU - Jingren Zhou AU - Junyang Lin PY - 2025 UR - https://arxiv.org/abs/2512.01374 ID - 2512.01374 ER -