@article{similarityasrewardalignmentrobustandvers, title = {Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning}, author = {Sara Rajaram and R. James Cotton and Fabian H. Sinz}, year = {2025}, eprint = {2506.12529}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2506.12529}, }