強化學習理論

廣義優勢估計(generalized advantage estimation, GAE)

廣義優勢估計提供一個可調的方式,回答每個策略梯度方法都得面對的問題:這個動作比平均好多少?單步時間差分(TD)估計變異數低,卻被可能不準的價值函數帶入偏誤;完整的蒙地卡羅回報無偏,但變異數很高。GAE 用單一旋鈕在這兩個極端之間插值。

它沿著軌跡對單步 TD 殘差做指數加權求和。令殘差 delta_t 等於報酬加上折扣後的下一狀態價值再減去當前價值,GAE 優勢便是對未來各步把 (gamma 乘 lambda) 取落後步數次方、再乘上該殘差後加總。把 lambda 設為零會還原成單步 TD 優勢;lambda 等於一則還原成蒙地卡羅優勢;介於兩者之間就在偏誤與變異數之間取捨。

GAE 是 PPO 與 TRPO 內部的標準優勢估計器。折扣 gamma 與跡參數 lambda 共同決定有效的規劃視野;常見預設是 gamma 約 0.99、lambda 約 0.95。

\hat{A}^{\mathrm{GAE}(\gamma,\lambda)}_t=\sum_{l=0}^{\infty}(\gamma\lambda)^l\,\delta_{t+l},\qquad \delta_t=r_t+\gamma V(s_{t+1})-V(s_t)

TD 殘差的指數加權和;lambda 從單步 TD 一路滑向完整的蒙地卡羅回報。

lambda 只調整優勢估計器的偏誤與變異數;gamma 則改變實際的目標函數。把兩者當成可互換來調,是常見的混淆。

又称
GAE廣義優勢估計