DPG
Deterministic Policy Gradient
2014년 도입 · 논문 20편에서 사용
Deterministic Policy Gradient, or DPG, is a policy gradient method for reinforcement learning. Instead of the policy function $\pi\left(.\mid{s}\right)$ being modeled as a probability distribution, DPG considers and calculates gradients for a deterministic policy $a = \mu\_{theta}\left(s\right)$.
Policy Gradient Methods · Reinforcement Learning