策略梯度方法
相容函數近似(compatible function approximation)
當你用學到的評論家取代真實價值時,你冒著評論家的錯誤汙染策略梯度的風險。相容函數近似是對這個問題的理論回答:哪些評論家是「安全的」——也就是說,哪些評論家即使只是近似,仍讓策略梯度保持完全不偏?答案出奇地具體又優雅。
當一個評論家的特徵恰好是策略自己的分數 ∇_θ log π_θ(a|s),並且以對真實動作價值的平方誤差最小化來配適時,它就是相容的。在這兩個條件下,評論家的誤差與梯度方向正交,所以把近似評論家代入策略梯度定理,得到的期望更新與用真實 Q 相同。實際上,這個評論家就是一個以分數為特徵、用最小平方配適的線性模型。
這個結果主要具理論意義——在深度強化學習裡我們很少強制嚴格相容——但它解釋了為何優勢演員–評論家方法能運作得這麼好,也是自然策略梯度的概念根源。要帶走的教訓是:並非每個評論家都無害,而決定它是否使梯度有偏的,是評論家的結構,不只是它的準確度。
又稱
另見