TY - RPRT TI - Fine-Grained Human Feedback Gives Better Rewards for Language Model Training AU - Zeqiu Wu AU - Yushi Hu AU - Weijia Shi AU - Nouha Dziri AU - Alane Suhr AU - Prithviraj Ammanabrolu AU - Noah A. Smith AU - Mari Ostendorf AU - Hannaneh Hajishirzi PY - 2023 UR - https://arxiv.org/abs/2306.01693 ID - 2306.01693 ER -