TY - RPRT TI - Expected Reasoning-Step Return Unifies On-Policy Learning from Rewards and Teachers AU - Qiangqiang He AU - Jin Li PY - 2026 UR - https://arxiv.org/abs/2609.32674 ID - 2609.32674 ER -