TY - RPRT TI - Supervised Reinforcement Learning: From Expert Trajectories to Step-wise Reasoning AU - Yihe Deng AU - I-Hung Hsu AU - Jun Yan AU - Zifeng Wang AU - Rujun Han AU - Gufeng Zhang AU - Yanfei Chen AU - Wei Wang AU - Tomas Pfister AU - Chen-Yu Lee PY - 2026 UR - https://arxiv.org/abs/2510.25992 ID - 2510.25992 ER -