@article{theaccuracyparadoxinrlhfwhenbetter, title = {The Accuracy Paradox in RLHF: When Better Reward Models Don't Yield Better Language Models}, author = {Yanjun Chen and Dawei Zhu and Yirong Sun and Xinghao Chen and Wei zhang and Xiaoyu Shen}, year = {2024}, eprint = {2410.06554}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2410.06554v2}, }