TY - RPRT TI - Progress- and Reliability-Oriented Group Policy Optimization for Agentic Reinforcement Learning AU - Mingxuan Fan AU - Peiyang Liu PY - 2026 UR - https://arxiv.org/abs/2607.04242 ID - 2607.04242 ER -