TY - RPRT TI - Lightning OPD: Efficient Post-Training for Large Reasoning Models with Offline On-Policy Distillation AU - Yecheng Wu AU - Song Han AU - Han Cai PY - 2026 UR - https://arxiv.org/abs/2604.13010 ID - 2604.13010 ER -