TY - RPRT TI - SFT-then-RL Outperforms Mixed-Policy Methods for LLM Reasoning AU - Alexis Limozin AU - Eduard Durech AU - Torsten Hoefler AU - Imanol Schlag AU - Valentina Pyatkin PY - 2026 UR - https://arxiv.org/abs/2604.23747 ID - 2604.23747 ER -