TY - RPRT TI - Scalable agent alignment via reward modeling: a research direction AU - Jan Leike AU - David Krueger AU - Tom Everitt AU - Miljan Martic AU - Vishal Maini AU - Shane Legg PY - 2018 UR - https://arxiv.org/abs/1811.07871 ID - 1811.07871 ER -