TY - RPRT TI - Fine-tuning Language Models with Generative Adversarial Reward Modelling AU - Zhang Ze Yu AU - Lau Jia Jaw AU - Zhang Hui AU - Bryan Kian Hsiang Low PY - 2024 UR - https://arxiv.org/abs/2305.06176 ID - 2305.06176 ER -