@article{saferlhfsafereinforcementlearningfrom, title = {Safe RLHF: Safe Reinforcement Learning from Human Feedback}, author = {Josef Dai and Xuehai Pan and Ruiyang Sun and Jiaming Ji and Xinbo Xu and Mickel Liu and Yizhou Wang and Yaodong Yang}, year = {2023}, eprint = {2310.12773}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2310.12773v1}, }