TY - RPRT TI - The Accuracy Paradox in RLHF: When Better Reward Models Don't Yield Better Language Models AU - Yanjun Chen AU - Dawei Zhu AU - Yirong Sun AU - Xinghao Chen AU - Wei Zhang AU - Xiaoyu Shen PY - 2024 UR - https://arxiv.org/abs/2410.06554 ID - 2410.06554 ER -