@misc{indiciae5735bec2a1cd, title = {Expected Reasoning-Step Return Unifies On-Policy Learning from Rewards and Teachers}, author = {Qiangqiang He and Jin Li}, year = {2026}, url = {https://arxiv.org/abs/2609.32674}, note = {Source identifier: 2609.32674} }