@misc{indiciaec03097aaf44d, title = {RLHF Deciphered: A Critical Analysis of Reinforcement Learning from Human Feedback for LLMs}, author = {Shreyas Chaudhari and Pranjal Aggarwal and Vishvak Murahari and Tanmay Rajpurohit and Ashwin Kalyan and Karthik Narasimhan and Ameet Deshpande and Bruno Castro da Silva}, year = {2024}, url = {https://arxiv.org/abs/2404.08555}, note = {Source identifier: 2404.08555} }