TY - RPRT TI - GPG: A Simple and Strong Reinforcement Learning Baseline for Model Reasoning AU - Xiangxiang Chu AU - Hailang Huang AU - Xiao Zhang AU - Fei Wei AU - Yong Wang PY - 2026 UR - https://arxiv.org/abs/2504.02546 ID - 2504.02546 ER -