paper-with-me

Bayesian REX

Bayesian Reward Extrapolation

2000년 도입 · 논문 1편에서 사용

Bayesian Reward Extrapolation is a Bayesian reward learning algorithm that scales to high-dimensional imitation learning problems by pre-training a low-dimensional feature encoding via self-supervised tasks and then leveraging preferences over demonstrations to perform fast Bayesian inference.

출처: Safe Imitation Learning via Fast Bayesian Reward Inference from Preferences

소개 논문: Safe Imitation Learning via Fast Bayesian Reward Inference from Preferences

Bayesian Reinforcement Learning · Reinforcement Learning