TY - RPRT TI - Supervised Fine-Tuning versus Reinforcement Learning: A Study of Post-Training Methods for Large Language Models AU - Haitao Jiang AU - Wenbo Zhang AU - Jiarui Yao AU - Hengrui Cai AU - Sheng Wang AU - Rui Song PY - 2026 UR - https://arxiv.org/abs/2603.13985 ID - 2603.13985 ER -