TY - RPRT TI - Training Language Models to Self-Correct via Reinforcement Learning AU - Aviral Kumar AU - Vincent Zhuang AU - Rishabh Agarwal AU - Yi Su AU - John D Co-Reyes AU - Avi Singh AU - Kate Baumli AU - Shariq Iqbal AU - Colton Bishop AU - Rebecca Roelofs AU - Lei M Zhang AU - Kay McKinney AU - Disha Shrivastava AU - Cosmin Paduraru AU - George Tucker AU - Doina Precup AU - Feryal Behbahani AU - Aleksandra Faust PY - 2024 UR - https://arxiv.org/abs/2409.12917 ID - 2409.12917 ER -