TY - RPRT TI - Good SFT Optimizes for SFT, Better SFT Prepares for Reinforcement Learning AU - Dylan Zhang AU - Yufeng Xu AU - Haojin Wang AU - Qingzhi Chen AU - Hao Peng PY - 2026 UR - https://arxiv.org/abs/2602.01058 ID - 2602.01058 ER -