TY - RPRT TI - RL Starts before RL: On Policy Distillation for Better Reinforcement Learning AU - Shuai Dong AU - Yongfu Zhu AU - Yuqi Xu AU - Weichu Xie AU - Liuwenpu AU - Ziyue Wang AU - Kaiwen Tuo AU - Congcong Wang AU - Siyuan Wang AU - Wenqi Shao AU - Shuai Yang AU - Ji Zhao AU - Caoyuan Ma AU - Wenzheng Chang AU - Taiqiang Wu AU - Xinlei Yu AU - Hongrui Wu AU - Xiaoxuan He AU - Fangke Chen AU - Dianyi Wang AU - Kanghui Tian AU - Sirry Chen AU - Xingyu Liu AU - Xiangnan Wu AU - Jiawei Guo AU - Haowen Hou AU - LingHan Chen AU - Zhongyu Wei AU - Jiaqi Wang PY - 2026 UR - https://arxiv.org/abs/2609.28145 ID - 2609.28145 ER -