@misc{indiciae593038e29fd9, title = {Meta-Rewarding Language Models: Self-Improving Alignment with LLM-as-a-Meta-Judge}, author = {Tianhao Wu and Weizhe Yuan and Olga Golovneva and Jing Xu and Yuandong Tian and Jiantao Jiao and Jason Weston and Sainbayar Sukhbaatar}, year = {2024}, url = {https://arxiv.org/abs/2407.19594}, note = {Source identifier: 2407.19594} }