@misc{indiciae4909507dde9e, title = {RL Starts before RL: On Policy Distillation for Better Reinforcement Learning}, author = {Shuai Dong and Yongfu Zhu and Yuqi Xu and Weichu Xie and Liuwenpu and Ziyue Wang and Kaiwen Tuo and Congcong Wang and Siyuan Wang and Wenqi Shao and Shuai Yang and Ji Zhao and Caoyuan Ma and Wenzheng Chang and Taiqiang Wu and Xinlei Yu and Hongrui Wu and Xiaoxuan He and Fangke Chen and Dianyi Wang and Kanghui Tian and Sirry Chen and Xingyu Liu and Xiangnan Wu and Jiawei Guo and Haowen Hou and LingHan Chen and Zhongyu Wei and Jiaqi Wang}, year = {2026}, url = {https://arxiv.org/abs/2609.28145}, note = {Source identifier: 2609.28145} }