paper-with-me

DPG

Deterministic Policy Gradient

2014년 도입 · 논문 20편에서 사용

Deterministic Policy Gradient, or DPG, is a policy gradient method for reinforcement learning. Instead of the policy function $\pi\left(.\mid{s}\right)$ being modeled as a probability distribution, DPG considers and calculates gradients for a deterministic policy $a = \mu\_{theta}\left(s\right)$.

Policy Gradient Methods · Reinforcement Learning