@misc{indiciae9e5f61d4ce82, title = {StepOPSD: Step-Aware Online Preference Self-Distillation for Agent Reinforcement Learning}, author = {Yanfei Zhang and Xu Lin and Chenglin Wu}, year = {2026}, url = {https://arxiv.org/abs/2605.27140}, note = {Source identifier: 2605.27140} }