TY - RPRT TI - Learning Optimal Advantage from Preferences and Mistaking it for Reward AU - W. Bradley Knox AU - Stephane Hatgis-Kessell AU - Sigurdur Orn Adalgeirsson AU - Serena Booth AU - Anca Dragan AU - Peter Stone AU - Scott Niekum PY - 2023 UR - https://arxiv.org/abs/2310.02456 ID - 2310.02456 ER -