TY - RPRT TI - GHPO: Adaptive Guidance for Stable and Efficient LLM Reinforcement Learning AU - Ziru Liu AU - Cheng Gong AU - Xinyu Fu AU - Yaofang Liu AU - Ran Chen AU - Shoubo Hu AU - Suiyun Zhang AU - Rui Liu AU - Qingfu Zhang AU - Dandan Tu PY - 2025 UR - https://arxiv.org/abs/2507.10628 ID - 2507.10628 ER -