TY - RPRT TI - Imitation Learning for Multi-turn LM Agents via On-policy Expert Corrections AU - Niklas Lauffer AU - Xiang Deng AU - Srivatsa Kundurthy AU - Brad Kenstler AU - Jeff Da PY - 2025 UR - https://arxiv.org/abs/2512.14895 ID - 2512.14895 ER -