@article{preferenceoptimizationviacontrastive, title = {Preference Optimization via Contrastive Divergence: Your Reward Model is Secretly an NLL Estimator}, author = {Zhuotong Chen and Fang Liu and Xuan Zhu and Yanjun Qi and Mohammad Ghavamzadeh}, year = {2025}, eprint = {2502.04567}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2502.04567v1}, }