TY - RPRT TI - RLSR: Reinforcement Learning with Supervised Reward Outperforms SFT in Instruction Following AU - Zhichao Wang AU - Andy Wong AU - Ruslan Belkin PY - 2025 UR - https://arxiv.org/abs/2510.14200 ID - 2510.14200 ER -