@article{personalizingreinforcementlearningfrom, title = {Personalizing Reinforcement Learning from Human Feedback with Variational Preference Learning}, author = {Sriyash Poddar and Yanming Wan and Hamish Ivison and Abhishek Gupta and Natasha Jaques}, year = {2024}, eprint = {2408.10075}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2408.10075v1}, }