TY - RPRT TI - Self-Distilled Agentic Reinforcement Learning AU - Zhengxi Lu AU - Zhiyuan Yao AU - Zhuowen Han AU - Zi-Han Wang AU - Jinyang Wu AU - Qi Gu AU - Xunliang Cai AU - Weiming Lu AU - Jun Xiao AU - Yueting Zhuang AU - Yongliang Shen PY - 2026 UR - https://arxiv.org/abs/2605.15155 ID - 2605.15155 ER -