策略梯度方法
廣義優勢估計(generalized advantage estimation, GAE)
GAE 化解了估計優勢時的核心張力。你可以用單步時間差分誤差:變異數低,但被評論家的錯誤帶偏。或者用完整的蒙地卡羅報酬:不偏,但極度地吵。GAE 給你單一旋鈕 λ(介於 0 與 1 之間),平滑地混合中間所有視界長度,讓你自選偏誤與變異數的取捨。
它的做法是對未來各步的時間差分殘差 δ_t = r_t + γV(s_{t+1}) − V(s_t) 取指數加權平均,往前 l 步的殘差權重為 (γλ)^l。當 λ=0,它退化成單步時間差分優勢(低變異、有偏);當 λ=1,它變成完整的蒙地卡羅優勢(不偏、高變異)。實務上 0.95 左右是常見的甜蜜點。
GAE 成為標準,是因為它便宜——只需對一段展開做一次反向掃描——又能與批次同策略方法完美搭配。它是多數 PPO 與 A2C 實作裡預設的優勢估計器。它誠實的提醒是:只要 λ 小於 1,它仍會繼承評論家 V 的任何系統性誤差。
\hat{A}^{\mathrm{GAE}}_t=\sum_{l=0}^{\infty}(\gamma\lambda)^l\,\delta_{t+l},\qquad \delta_t=r_t+\gamma V(s_{t+1})-V(s_t)
時間差分殘差的指數加權和;λ 在偏誤與變異數之間調節。
又称
另见