@article{selfrewardingppoaligninglargelanguagemod, title = {Self-Rewarding PPO: Aligning Large Language Models with Demonstrations Only}, author = {Qingru Zhang and Liang Qiu and Ilgee Hong and Zhenghao Xu and Tianyi Liu and Shiyang Li and Rongzhi Zhang and Zheng Li and Lihong Li and Bing Yin and Chao Zhang and Jianshu Chen and Haoming Jiang and Tuo Zhao}, year = {2025}, eprint = {2510.21090}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2510.21090}, }