@article{sequencetosequencerewardmodeling, title = {Sequence to Sequence Reward Modeling: Improving RLHF by Language Feedback}, author = {Jiayi Zhou and Jiaming Ji and Juntao Dai and Yaodong Yang}, year = {2024}, eprint = {2409.00162}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2409.00162v1}, }