策略梯度方法
以優勢為基礎的更新(advantage-based update)
以優勢為基礎的更新,是基準線想法的自然終點。它不再問「這整回合好不好?」,而是問更銳利的問題「這個動作,是否比這個狀態下平均可選的動作更好?」。這個比較就是優勢 A(s,a) = Q(s,a) − V(s):正值代表動作勝過該狀態的預設,負值代表它表現不如預期。
在策略梯度裡,你用優勢取代原始報酬,於是更新變成 ∇_θ log π_θ(a|s) 乘 A(s,a)。因為 V(s) 扮演理想的基準線,優勢會被置中在零附近,這在保持梯度不偏的同時大幅降低變異數。評論家估 V(或 Q),演員依優勢加權的梯度前進,兩者一起訓練——這正是 A2C、A3C、以 GAE 為基礎的方法乃至 PPO 的核心迴圈。
代價是優勢如今成了估計,所以評論家的誤差會以偏誤的形式滲入。各方法主要差在如何估計優勢:單步時間差分變異數低但有偏,完整蒙地卡羅不偏但很吵,而廣義優勢估計則用單一旋鈕在兩者之間滑動。
A^{\pi}(s,a)=Q^{\pi}(s,a)-V^{\pi}(s)
優勢 = 一個動作比該狀態平均動作好多少。
又称
另见