TY - RPRT TI - $β$-OPSD: Deriving with Policy Optimization, Training with Self-Distillation AU - Jiawei Xu AU - Minghui Liu AU - Juzheng Zhang AU - Tom Goldstein AU - Furong Huang PY - 2026 UR - https://arxiv.org/abs/2607.28582 ID - 2607.28582 ER -