TY - RPRT TI - The Capacity for Moral Self-Correction in Large Language Models AU - Deep Ganguli AU - Amanda Askell AU - Nicholas Schiefer AU - Thomas I. Liao AU - Kamilė Lukošiūtė AU - Anna Chen AU - Anna Goldie AU - Azalia Mirhoseini AU - Catherine Olsson AU - Danny Hernandez AU - Dawn Drain AU - Dustin Li AU - Eli Tran-Johnson AU - Ethan Perez AU - Jackson Kernion AU - Jamie Kerr AU - Jared Mueller AU - Joshua Landau AU - Kamal Ndousse AU - Karina Nguyen AU - Liane Lovitt AU - Michael Sellitto AU - Nelson Elhage AU - Noemi Mercado AU - Nova DasSarma AU - Oliver Rausch AU - Robert Lasenby AU - Robin Larson AU - Sam Ringer AU - Sandipan Kundu AU - Saurav Kadavath AU - Scott Johnston AU - Shauna Kravec AU - Sheer El Showk AU - Tamera Lanham AU - Timothy Telleen-Lawton AU - Tom Henighan AU - Tristan Hume AU - Yuntao Bai AU - Zac Hatfield-Dodds AU - Ben Mann AU - Dario Amodei AU - Nicholas Joseph AU - Sam McCandlish AU - Tom Brown AU - Christopher Olah AU - Jack Clark AU - Samuel R. Bowman AU - Jared Kaplan PY - 2023 UR - https://arxiv.org/abs/2302.07459 ID - 2302.07459 ER -