TY - RPRT TI - Agentic Reinforcement Learning with Self-Distilled Reward Shaping AU - Ranxu Zhang AU - Guinan Chen AU - Chenshaodong AU - Jinghao Lin AU - Xiaozhou Xu AU - Sunzhe AU - Yanyong Zhang AU - Chao Wang PY - 2026 UR - https://arxiv.org/abs/2608.03223 ID - 2608.03223 ER -