TY - RPRT TI - On the Non-decoupling of Supervised Fine-tuning and Reinforcement Learning in Post-training AU - Xueyan Niu AU - Bo Bai AU - Wei Han AU - Weixi Zhang PY - 2026 UR - https://arxiv.org/abs/2601.07389 ID - 2601.07389 ER -