TY - RPRT TI - CPGD: Toward Stable Rule-based Reinforcement Learning for Language Models AU - Zongkai Liu AU - Fanqing Meng AU - Lingxiao Du AU - Zhixiang Zhou AU - Chao Yu AU - Wenqi Shao AU - Qiaosheng Zhang PY - 2025 UR - https://arxiv.org/abs/2505.12504 ID - 2505.12504 ER -