TY - RPRT TI - A Practical Two-Stage Recipe for Mathematical LLMs: Maximizing Accuracy with SFT and Efficiency with Reinforcement Learning AU - Hiroshi Yoshihara AU - Taiki Yamaguchi AU - Yuichi Inoue PY - 2025 UR - https://arxiv.org/abs/2507.08267 ID - 2507.08267 ER -