@article{weaktostrongpreferenceoptimization, title = {Weak-to-Strong Preference Optimization: Stealing Reward from Weak Aligned Model}, author = {Wenhong Zhu and Zhiwei He and XiaoFeng Wang and PengFei Liu and Rui Wang}, year = {2024}, eprint = {2410.18640}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2410.18640v1}, }