@article{rrmrobustrewardmodeltrainingmitigates, title = {RRM: Robust Reward Model Training Mitigates Reward Hacking}, author = {Tianqi Liu and Wei Xiong and Jie Ren and Lichang Chen and Junru Wu and Rishabh Joshi and Yang Gao and Jiaming Shen and Zhen Qin and Tianhe Yu and Daniel Sohn and Anastasiia Makarova and Jeremiah Liu and YuAn Liu and Bilal Piot and Abe Ittycheriah and Aviral Kumar and Mohammad Saleh}, year = {2024}, eprint = {2409.13156}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2409.13156v1}, }