@article{metarewardinglanguagemodelsselfimproving, title = {Meta-Rewarding Language Models: Self-Improving Alignment with LLM-as-a-Meta-Judge}, author = {Tianhao Wu and Weizhe Yuan and Olga Golovneva and Jing Xu and Yuandong Tian and Jiantao Jiao and Jason Weston and Sainbayar Sukhbaatar}, year = {2024}, eprint = {2407.19594}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2407.19594v2}, }