@misc{indiciae057d445e0b12, title = {SIPO: Unifying Reinforcement Learning with On-Policy Self-Distillation}, author = {Zhenrui Yue and Huimin Zeng and Yueqi Wang and Yaokun Liu and Fengran Mo and Jinghan Zhang and Mung Yao Jia and Gyuseok Lee and Yang Zhang and Na Wei and Dong Wang}, year = {2026}, url = {https://arxiv.org/abs/2609.36742}, note = {Source identifier: 2609.36742} }