策略梯度方法
未來報酬(reward-to-go)
天真的 REINFORCE 用同一個總報酬替回合裡每個動作加權——包括在該動作做出之前就到手的獎勵。這顯然不公平:一個動作不可能造成過去的獎勵。未來報酬修正了這點,做法是每個動作只記它之後到來的獎勵,也就是從那一步起算的報酬。這是個小改動,對雜訊卻有超乎比例的效果。
理由是因果性:在期望意義下,把分數乘上動作之前賺到的獎勵,對梯度的貢獻為零,因為過去的獎勵與目前動作的分數獨立。所以丟掉那些項仍讓梯度不偏,卻移除了一塊純粹的雜訊。每個動作的權重於是變成 G_t = Σ_{t'≥t} γ^{t'−t} r_{t'},而不是整段軌跡的報酬。
未來報酬是最便宜也最可靠的變異數削減器之一,並能與基準線和優勢自由組合——事實上,優勢估計就建立在未來報酬之上。它通常是你寫完教科書版策略梯度後做的第一個改良,而幾乎每個正經的實作都預設包含它。
\nabla_\theta J=\mathbb{E}\!\left[\sum_t \nabla_\theta\log\pi_\theta(a_t\mid s_t)\sum_{t'\ge t}\gamma^{t'-t} r_{t'}\right]
每個動作只由它之後的報酬來加權。
又稱
另見