@misc{indiciae74b9d3846911, title = {RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback}, author = {Harrison Lee and Samrat Phatale and Hassan Mansoor and Thomas Mesnard and Johan Ferret and Kellie Lu and Colton Bishop and Ethan Hall and Victor Carbune and Abhinav Rastogi and Sushant Prakash}, year = {2024}, url = {https://arxiv.org/abs/2309.00267}, note = {Source identifier: 2309.00267} }