@misc{indiciaec43e21f72002, title = {Iterative Nash Policy Optimization: Aligning LLMs with General Preferences via No-Regret Learning}, author = {Yuheng Zhang and Dian Yu and Baolin Peng and Linfeng Song and Ye Tian and Mingyue Huo and Nan Jiang and Haitao Mi and Dong Yu}, year = {2025}, url = {https://arxiv.org/abs/2407.00617}, note = {Source identifier: 2407.00617} }