@article{beyondrewardhackingcausalrewardsfor, title = {Beyond Reward Hacking: Causal Rewards for Large Language Model Alignment}, author = {Chaoqi Wang and Zhuokai Zhao and Yibo Jiang and Zhaorun Chen and Chen Zhu and Yuxin Chen and Jiayi Liu and Lizhu Zhang and Xiangjun Fan and Hao Ma and Sinong Wang}, year = {2025}, eprint = {2501.09620}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2501.09620v1}, }