@article{coprcontinualhumanpreferencelearningvia, title = {COPR: Continual Human Preference Learning via Optimal Policy Regularization}, author = {Han Zhang and Lin Gui and Yu Lei and Yuanzhao Zhai and Yehong Zhang and Yulan He and Hui Wang and Yue Yu and Kam-Fai Wong and Bin Liang and Ruifeng Xu}, year = {2024}, eprint = {2402.14228}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2402.14228v3}, }