TY - RPRT TI - CE-GPPO: Coordinating Entropy via Gradient-Preserving Clipping Policy Optimization in Reinforcement Learning AU - Zhenpeng Su AU - Leiyu Pan AU - Minxuan Lv AU - Yuntao Li AU - Wenping Hu AU - Fuzheng Zhang AU - Kun Gai AU - Guorui Zhou PY - 2026 UR - https://arxiv.org/abs/2509.20712 ID - 2509.20712 ER -