進階策略優化

自然策略梯度(natural policy gradient)

普通的策略梯度指向參數空間中的上坡方向,但參數空間是一張會騙人的地圖:對某個權重做極小的微調可能讓策略劇烈擺動,而對另一個權重做大幅改動卻幾乎不改行為。自然策略梯度把這張地圖修正過來。它用「策略的動作分佈實際改變了多少」來量距離,而不是用「權重向量裡的數字改變了多少」,再在這個誠實、看得見行為的距離概念下,走出最陡上升的一步。

在數學上,你用費雪資訊矩陣(Fisher information matrix)的逆來預條件化原始梯度,而這個矩陣正是鄰近策略之間 KL 散度的局部曲率。如此一來,更新就與你恰好怎麼參數化策略無關,進步也不再卡在參數空間裡平坦或歪斜的區域。TRPO 本質上就是加了信賴域步長規則的自然策略梯度;精確算出費雪逆矩陣太貴,所以實用方法會用共軛梯度來近似它。

\tilde{g}=F^{-1}g,\qquad g=\nabla_\theta J(\theta)

用費雪矩陣 F 的逆,對原始梯度 g 做預條件化。

又称
NPG