TY - RPRT TI - PR-OPD: Privileged Representation On-policy Self-Distillation for Agentic Reinforcement Learning AU - Muyang Li AU - Jie Yang AU - Zhengyu Fang AU - Junchao Zhu AU - Zhengkun Xiao AU - Ruining Deng AU - Zhe Jiang AU - Shigang Chen PY - 2026 UR - https://arxiv.org/abs/2609.36642 ID - 2609.36642 ER -