TY - RPRT TI - Supervised Fine-Tuning as Inverse Reinforcement Learning AU - Hao Sun PY - 2024 UR - https://arxiv.org/abs/2403.12017 ID - 2403.12017 ER -