TY - RPRT TI - OPID: On-Policy Skill Distillation for Agentic Reinforcement Learning AU - Shuo Yang AU - Jinyang Wu AU - Zhengxi Lu AU - Yuhao Shen AU - Fan Zhang AU - Lang Feng AU - Shuai Zhang AU - Haoran Luo AU - Zheng Lian AU - Zhengqi Wen AU - Jianhua Tao PY - 2026 UR - https://arxiv.org/abs/2606.26790 ID - 2606.26790 ER -