TY - RPRT TI - Self-Supervised On-Policy Distillation for Reasoning Language Models AU - Zhiquan Tan AU - Yinrong Hong PY - 2026 UR - https://arxiv.org/abs/2605.17497 ID - 2605.17497 ER -