@misc{indiciaea9d637b0ee5c, title = {The Accuracy Paradox in RLHF: When Better Reward Models Don't Yield Better Language Models}, author = {Yanjun Chen and Dawei Zhu and Yirong Sun and Xinghao Chen and Wei Zhang and Xiaoyu Shen}, year = {2024}, url = {https://arxiv.org/abs/2410.06554}, note = {Source identifier: 2410.06554} }