@article{coopercooptimizingpolicyandrewardmodelsi, title = {Cooper: Co-Optimizing Policy and Reward Models in Reinforcement Learning for Large Language Models}, author = {Haitao Hong and Yuchen Yan and Xingyu Wu and Guiyang Hou and Wenqi Zhang and Weiming Lu and Yongliang Shen and Jun Xiao}, year = {2025}, eprint = {2508.05613}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2508.05613}, }