策略梯度方法
確定性策略梯度(deterministic policy gradient, DPG)
標準策略梯度假設一個你能抽樣、也能取對數機率的隨機策略。但在連續控制裡——轉動方向盤、為關節施加扭矩——輸出一個特定動作、也就是確定性函數 μ_θ(s),往往更乾淨。確定性策略梯度正是為這種情況打造的更新形式,它以一種發人深省的方式改變了數學。
DPG 不再用報酬替分數加權,而是沿連鎖律直接穿過評論家:它是 ∇_θ μ_θ(s) 乘 ∇_a Q(s,a)(在 a = μ_θ(s) 處取值)的期望。換句話說,把演員輸出的動作往評論家說「能增加價值」的方向推一點,再調參數去產生那個推過的動作。因為沒有動作分布要積分,這個估計式的變異數通常比它的隨機表親低得多。
代價在於探索:確定性演員自己不會探索,所以訓練時你必須把雜訊注入動作,這讓 DPG 本質上是離策略的。這正是 DDPG 與 TD3 背後的配方——連續控制的主力深度方法,其中一個可微的評論家提供動作梯度。
\nabla_\theta J=\mathbb{E}_{s}\!\left[\nabla_\theta \mu_\theta(s)\,\nabla_a Q^{\mu}(s,a)\big|_{a=\mu_\theta(s)}\right]
把評論家的動作梯度沿確定性演員串連起來。
又称
另见