@misc{indiciaeb303e6ff4a0f, title = {Supervised Reinforcement Learning: From Expert Trajectories to Step-wise Reasoning}, author = {Yihe Deng and I-Hung Hsu and Jun Yan and Zifeng Wang and Rujun Han and Gufeng Zhang and Yanfei Chen and Wei Wang and Tomas Pfister and Chen-Yu Lee}, year = {2026}, url = {https://arxiv.org/abs/2510.25992}, note = {Source identifier: 2510.25992} }