強化學習理論

自然策略梯度(natural policy gradient, NPG)

普通的策略梯度在參數空間中量距離,但參數是把很差的尺:兩個截然不同的參數向量可能給出幾乎相同的策略,而極小的參數變動卻可能讓策略整個翻轉。自然策略梯度改為在分布空間中量距離,因此它的步伐對「策略恰好如何被參數化」是不變的。

它以費雪資訊矩陣(Fisher information matrix)的逆作為梯度的前置條件,而費雪矩陣正是 KL 散度在策略空間上誘導出的二階度量。更新沿「費雪逆矩陣乘以梯度」的方向推進參數,那是在該自然幾何下最陡上升的方向。信賴域策略最佳化本質上就是這一步再加 KL 約束的線搜尋;實務上從不顯式對費雪矩陣求逆:用費雪向量積搭配共軛梯度便能廉價地算出方向。

由於它依循策略分布的幾何,自然梯度對重參數化不變,並是 TRPO、ACKTR 及相關方法的基礎。

\tilde{\nabla}J=F^{-1}\nabla_{\theta}J,\qquad F=\mathbb{E}\!\left[\nabla_{\theta}\log\pi_{\theta}\,\nabla_{\theta}\log\pi_{\theta}^{\top}\right]

以費雪矩陣的逆(即策略空間上的 KL 度量)作為策略梯度的前置條件。

自然梯度是在 KL 幾何下、而非歐氏參數空間中的最陡上升;正是這種不變性,使它勝過原始策略梯度。

又称
NPG自然策略梯度