TY - RPRT TI - Preference Fine-Tuning of LLMs Should Leverage Suboptimal, On-Policy Data AU - Fahim Tajwar AU - Anikait Singh AU - Archit Sharma AU - Rafael Rafailov AU - Jeff Schneider AU - Tengyang Xie AU - Stefano Ermon AU - Chelsea Finn AU - Aviral Kumar PY - 2024 UR - https://arxiv.org/abs/2404.14367 ID - 2404.14367 ER -