TY - RPRT TI - Direct Nash Optimization: Teaching Language Models to Self-Improve with General Preferences AU - Corby Rosset AU - Ching-An Cheng AU - Arindam Mitra AU - Michael Santacroce AU - Ahmed Awadallah AU - Tengyang Xie PY - 2024 UR - https://arxiv.org/abs/2404.03715 ID - 2404.03715 ER -