TY - RPRT TI - Iterative Nash Policy Optimization: Aligning LLMs with General Preferences via No-Regret Learning AU - Yuheng Zhang AU - Dian Yu AU - Baolin Peng AU - Linfeng Song AU - Ye Tian AU - Mingyue Huo AU - Nan Jiang AU - Haitao Mi AU - Dong Yu PY - 2025 UR - https://arxiv.org/abs/2407.00617 ID - 2407.00617 ER -