@misc{indiciae441fe28eea6e, title = {Fine-Grained Human Feedback Gives Better Rewards for Language Model Training}, author = {Zeqiu Wu and Yushi Hu and Weijia Shi and Nouha Dziri and Alane Suhr and Prithviraj Ammanabrolu and Noah A. Smith and Mari Ostendorf and Hannaneh Hajishirzi}, year = {2023}, url = {https://arxiv.org/abs/2306.01693}, note = {Source identifier: 2306.01693} }