TY - RPRT TI - Learning to Explore: Scaling Agentic Reasoning via Exploration-Aware Policy Optimization AU - Xingyuan Hua AU - Sheng Yue AU - Ju Ren PY - 2026 UR - https://arxiv.org/abs/2605.08978 ID - 2605.08978 ER -