TY - RPRT TI - Improving Reward Models with Synthetic Critiques AU - Zihuiwen Ye AU - Fraser Greenlee-Scott AU - Max Bartolo AU - Phil Blunsom AU - Jon Ander Campos AU - Matthias Gallé PY - 2024 UR - https://arxiv.org/abs/2405.20850 ID - 2405.20850 ER -