@article{improvingreinforcementlearningfromhuman, title = {Improving Reinforcement Learning from Human Feedback with Efficient Reward Model Ensemble}, author = {Shun Zhang and Zhenfang Chen and Sunli Chen and Yikang Shen and Zhiqing Sun and Chuang Gan}, year = {2024}, eprint = {2401.16635}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2401.16635v3}, }