@article{sentencelevelrewardmodelcangeneralize, title = {Sentence-level Reward Model can Generalize Better for Aligning LLM from Human Preference}, author = {Wenjie Qiu and Yi-Chen Li and Xuqin Zhang and Tianyi Zhang and Yihang Zhang and Zongzhang Zhang and Yang Yu}, year = {2025}, eprint = {2503.04793}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2503.04793v4}, }