@misc{indiciae8dc3e36e27aa, title = {Extragradient Preference Optimization (EGPO): Beyond Last-Iterate Convergence for Nash Learning from Human Feedback}, author = {Runlong Zhou and Maryam Fazel and Simon S. Du}, year = {2025}, url = {https://arxiv.org/abs/2503.08942}, note = {Source identifier: 2503.08942} }