DPO
Direct Preference Optimization
2000년 도입 · 논문 409편에서 사용
출처: Direct Preference Optimization: Your Language Model is Secretly a Reward Model
소개 논문: Direct Preference Optimization: Your Language Model is Secretly a Reward Model
Offline Reinforcement Learning Methods · Reinforcement Learning