paper-with-me

DPO

Direct Preference Optimization

2000년 도입 · 논문 409편에서 사용

출처: Direct Preference Optimization: Your Language Model is Secretly a Reward Model

소개 논문: Direct Preference Optimization: Your Language Model is Secretly a Reward Model

Offline Reinforcement Learning Methods · Reinforcement Learning