TY - RPRT TI - RLHF Deciphered: A Critical Analysis of Reinforcement Learning from Human Feedback for LLMs AU - Shreyas Chaudhari AU - Pranjal Aggarwal AU - Vishvak Murahari AU - Tanmay Rajpurohit AU - Ashwin Kalyan AU - Karthik Narasimhan AU - Ameet Deshpande AU - Bruno Castro da Silva PY - 2024 UR - https://arxiv.org/abs/2404.08555 ID - 2404.08555 ER -