@article{iterativenashpolicyoptimizationaligning, title = {Iterative Nash Policy Optimization: Aligning LLMs with General Preferences via No-Regret Learning}, author = {Yuheng Zhang and Dian Yu and Baolin Peng and Linfeng Song and Ye Tian and Mingyue Huo and Nan Jiang and Haitao Mi and Dong Yu}, year = {2024}, eprint = {2407.00617}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2407.00617v4}, }