TY - RPRT TI - Training language models to follow instructions with human feedback AU - Long Ouyang AU - Jeff Wu AU - Xu Jiang AU - Diogo Almeida AU - Carroll L. Wainwright AU - Pamela Mishkin AU - Chong Zhang AU - Sandhini Agarwal AU - Katarina Slama AU - Alex Ray AU - John Schulman AU - Jacob Hilton AU - Fraser Kelton AU - Luke Miller AU - Maddie Simens AU - Amanda Askell AU - Peter Welinder AU - Paul Christiano AU - Jan Leike AU - Ryan Lowe PY - 2022 UR - https://arxiv.org/abs/2203.02155 ID - 2203.02155 ER -