TY - RPRT TI - Direct Preference Optimization: Your Language Model is Secretly a Reward Model AU - Rafael Rafailov AU - Archit Sharma AU - Eric Mitchell AU - Stefano Ermon AU - Christopher D. Manning AU - Chelsea Finn PY - 2024 UR - https://arxiv.org/abs/2305.18290 ID - 2305.18290 ER -