TY - RPRT TI - GEPO: Group Expectation Policy Optimization for Stable Heterogeneous Reinforcement Learning AU - Han Zhang AU - Ruibin Zheng AU - Zexuan Yi AU - Zhuo Zhang AU - Hanyang Peng AU - Hui Wang AU - Zike Yuan AU - Cai Ke AU - Shiwei Chen AU - Jiacheng Yang AU - Yangning Li AU - Xiang Li AU - Jiangyue Yan AU - Yaoqi Liu AU - Liwen Jing AU - Jiayin Qi AU - Ruifeng Xu AU - Binxing Fang AU - Yue Yu PY - 2026 UR - https://arxiv.org/abs/2508.17850 ID - 2508.17850 ER -