@article{rsdpoahybridrejectionsamplinganddirect, title = {RS-DPO: A Hybrid Rejection Sampling and Direct Preference Optimization Method for Alignment of Large Language Models}, author = {Saeed Khaki and Jinjin Li and Lan Ma and Liu Yang and Prathap Ramachandra}, year = {2024}, eprint = {2402.10038}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2402.10038v2}, }