TY - RPRT TI - Extragradient Preference Optimization (EGPO): Beyond Last-Iterate Convergence for Nash Learning from Human Feedback AU - Runlong Zhou AU - Maryam Fazel AU - Simon S. Du PY - 2025 UR - https://arxiv.org/abs/2503.08942 ID - 2503.08942 ER -