TY - RPRT TI - SIPO: Unifying Reinforcement Learning with On-Policy Self-Distillation AU - Zhenrui Yue AU - Huimin Zeng AU - Yueqi Wang AU - Yaokun Liu AU - Fengran Mo AU - Jinghan Zhang AU - Mung Yao Jia AU - Gyuseok Lee AU - Yang Zhang AU - Na Wei AU - Dong Wang PY - 2026 UR - https://arxiv.org/abs/2609.36742 ID - 2609.36742 ER -