TY - RPRT TI - Group-Graph Policy Optimization for Long-Horizon Agentic Reinforcement Learning AU - Yunan Wang AU - Minghui Song AU - Zihan Zhang AU - Shaohan Huang AU - Haizhen Huang AU - Furu Wei AU - Weiwei Deng AU - Feng Sun AU - Qi Zhang PY - 2026 UR - https://arxiv.org/abs/2606.22995 ID - 2606.22995 ER -