@article{sampleefficientreinforcementlearningfrom, title = {Sample Efficient Preference Alignment in LLMs via Active Exploration}, author = {Viraj Mehta and Syrine Belakaria and Vikramjeet Das and Ojash Neopane and Yijia Dai and Ilija Bogunovic and Barbara Engelhardt and Stefano Ermon and Jeff Schneider and Willie Neiswanger}, year = {2023}, eprint = {2312.00267}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2312.00267v3}, }