Bayesian REX
Bayesian Reward Extrapolation
2000년 도입 · 논문 1편에서 사용
Bayesian Reward Extrapolation is a Bayesian reward learning algorithm that scales to high-dimensional imitation learning problems by pre-training a low-dimensional feature encoding via self-supervised tasks and then leveraging preferences over demonstrations to perform fast Bayesian inference.
출처: Safe Imitation Learning via Fast Bayesian Reward Inference from Preferences
소개 논문: Safe Imitation Learning via Fast Bayesian Reward Inference from Preferences
Bayesian Reinforcement Learning · Reinforcement Learning