@article{gibbssamplingfromhumanfeedbackaprovable, title = {Iterative Preference Learning from Human Feedback: Bridging Theory and Practice for RLHF under KL-Constraint}, author = {Wei Xiong and Hanze Dong and Chenlu Ye and Ziqi Wang and Han Zhong and Heng Ji and Nan Jiang and Tong Zhang}, year = {2023}, eprint = {2312.11456}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2312.11456v4}, }