TY - RPRT TI - Trajectory Improvement and Reward Learning from Comparative Language Feedback AU - Zhaojing Yang AU - Miru Jun AU - Jeremy Tien AU - Stuart J. Russell AU - Anca Dragan AU - Erdem Bıyık PY - 2024 UR - https://arxiv.org/abs/2410.06401 ID - 2410.06401 ER -