進階策略優化
策略的費雪資訊(Fisher information of a policy)
費雪資訊矩陣是一種曲率,它告訴自然策略梯度哪些方向敏感、哪些方向遲鈍。想像你站在策略的損失曲面上:在某些方向,參數的微小移動幾乎不改變策略的行為,在另一些方向,卻會讓動作機率猛然甩動。費雪矩陣正是分數(score,也就是所選動作對數機率的梯度)的平均外積,因此它刻畫了每個參數方向把策略行為重塑得多劇烈。
關鍵在於,這個矩陣正是某策略與其鄰近策略之間 KL 散度的二階(局部二次)近似。這就是為什麼用它的逆做預條件化,能把參數空間裡的一步,變成行為空間裡受控的一步;也是為什麼二次的 KL 約束可化約成透過費雪矩陣表示的形式。對深度策略而言,整個矩陣大到無法成形,因此方法從不真的建出它,只需要費雪—向量乘積,而共軛梯度能高效地提供這個乘積。
F=\mathbb{E}_{s,a\sim\pi}\!\big[\nabla_\theta\log\pi_\theta(a\mid s)\,\nabla_\theta\log\pi_\theta(a\mid s)^{\top}\big]
費雪矩陣是策略分數函數外積的期望值。
又稱
另見