策略梯度方法

策略梯度定理(policy gradient theorem)

想像你要教一台機器人走路,而你唯一能動的,只有它決策規則裡那組旋鈕(參數)。策略梯度定理告訴你旋鈕該往哪轉:把後續報酬好的動作機率調高,把報酬差的調低。最美妙的是,你完全不需要知道世界會如何回應你的旋鈕——只需要知道你自己的動作機率如何隨參數變化。

嚴格地說,把目標 J(θ) 定義為策略 π_θ 的期望報酬。定理指出,它的梯度等於對軌跡取期望,內容是分數 ∇_θ log π_θ(a|s) 乘上動作價值 Q^π(s,a) 的加權。環境的轉移機率在微分時消失了,因為它們不依賴 θ,於是你只要抽樣許多回合再取平均,就能估出整個梯度——這正是這個方法之所以可行的關鍵。

這一個結果撐起了本領域的每個演算法:REINFORCE、演員–評論家、A2C、PPO 全都是在估計或穩定它。它的罩門是變異數——Q 權重在不同回合間劇烈震盪,所以原始估計很吵、學得很慢。基準線、優勢與評論家的存在,全是為了在不改變方向(不引入偏誤)的前提下削減這份變異。

\nabla_\theta J(\theta)=\mathbb{E}_{\tau\sim\pi_\theta}\left[\sum_t \nabla_\theta \log\pi_\theta(a_t\mid s_t)\,Q^{\pi}(s_t,a_t)\right]

依動作價值的好壞,按比例推高該動作的對數機率。

又称
likelihood-ratio policy gradient