TY - RPRT TI - StepOPSD: Step-Aware Online Preference Self-Distillation for Agent Reinforcement Learning AU - Yanfei Zhang AU - Xu Lin AU - Chenglin Wu PY - 2026 UR - https://arxiv.org/abs/2605.27140 ID - 2605.27140 ER -