@misc{indiciaeb8715f724520, title = {Training Language Models to Self-Correct via Reinforcement Learning}, author = {Aviral Kumar and Vincent Zhuang and Rishabh Agarwal and Yi Su and John D Co-Reyes and Avi Singh and Kate Baumli and Shariq Iqbal and Colton Bishop and Rebecca Roelofs and Lei M Zhang and Kay McKinney and Disha Shrivastava and Cosmin Paduraru and George Tucker and Doina Precup and Feryal Behbahani and Aleksandra Faust}, year = {2024}, url = {https://arxiv.org/abs/2409.12917}, note = {Source identifier: 2409.12917} }