TY - RPRT TI - Wasserstein Distributionally Robust Regret Optimization for Reinforcement Learning from Human Feedback AU - Yikai Wang AU - Shang Liu AU - Jose Blanchet PY - 2026 UR - https://arxiv.org/abs/2605.00155 ID - 2605.00155 ER -