TY - RPRT TI - Agentic Reinforcement Learning with Observation-Calibrated Self-Distillation AU - Yi Yang AU - Cong Qin AU - Xiaodan Liu AU - Chishui Chen AU - Qing Dong AU - Yan Zhang AU - Cao Liu AU - Zhao Yang AU - Lu Pan AU - Jiaye Lin AU - Yi Feng PY - 2026 UR - https://arxiv.org/abs/2608.04788 ID - 2608.04788 ER -