@article{interpretingrewardmodelsinrlhftuned, title = {Interpreting Learned Feedback Patterns in Large Language Models}, author = {Luke Marks and Amir Abdullah and Clement Neo and Rauno Arike and David Krueger and Philip Torr and Fazl Barez}, year = {2023}, eprint = {2310.08164}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2310.08164v5}, }