TY - RPRT TI - Meta-Rewarding Language Models: Self-Improving Alignment with LLM-as-a-Meta-Judge AU - Tianhao Wu AU - Weizhe Yuan AU - Olga Golovneva AU - Jing Xu AU - Yuandong Tian AU - Jiantao Jiao AU - Jason Weston AU - Sainbayar Sukhbaatar PY - 2024 UR - https://arxiv.org/abs/2407.19594 ID - 2407.19594 ER -