TY - RPRT TI - Supervised Fine Tuning on Curated Data is Reinforcement Learning (and can be improved) AU - Chongli Qin AU - Jost Tobias Springenberg PY - 2025 UR - https://arxiv.org/abs/2507.12856 ID - 2507.12856 ER -