TY - RPRT TI - Deep reinforcement learning from human preferences AU - Paul Christiano AU - Jan Leike AU - Tom B. Brown AU - Miljan Martic AU - Shane Legg AU - Dario Amodei PY - 2023 UR - https://arxiv.org/abs/1706.03741 ID - 1706.03741 ER -