策略梯度方法

對數導數技巧(log-derivative trick)

這是讓策略梯度成立的那一小段微積分,值得單獨看一次。這個恆等式不過是反過來用的連鎖律:機率密度的梯度等於密度乘上它對數的梯度。用符號寫就是 ∇_θ p_θ(x) = p_θ(x) ∇_θ log p_θ(x)。看似平凡,卻是整個領域的樞紐。

它為什麼這麼有用?當你對期望 E_{x∼p_θ}[f(x)] 微分時,會碰到 f(x) 乘 ∇_θ p_θ(x) 的和(或積分)。最後那一項不是期望,所以無法抽樣。代入這個恆等式後,p_θ(x) 又折回你正在取平均的那個機率裡,剩下 f(x) ∇_θ log p_θ(x)——它又變回期望,因此可以抽樣。

每個分數函數估計式、REINFORCE,乃至策略梯度定理本身,都是把這一次代換用在期望報酬上。認得它,你就能當場推導新的估計式;它也點明了這個技巧的極限:它忽略了 f 直接依賴 θ 的任何路徑,而那正是重參數化與隨機計算圖登場之處。

\nabla_\theta p_\theta(x)=p_\theta(x)\,\nabla_\theta\log p_\theta(x)

把密度的梯度化成可抽樣形式的那個恆等式。

又称
log-likelihood trick