強化學習理論
信賴域策略最佳化(trust region policy optimization, TRPO)
信賴域策略最佳化就是「綁上韁繩」的策略梯度。原始策略梯度的危險在於:一次過大的更新可能讓原本可用的策略徹底崩潰且無法挽回。TRPO 以新舊動作分布之間的 KL 散度來衡量,限制每次更新能把策略推多遠,讓每一步都待在「信賴域」內,使局部近似仍然可信。
它在「平均 KL 距離不超過一個小上界」的約束下,最大化以重要性加權的代理優勢(surrogate advantage)。這個帶約束的步伐沿自然梯度方向求解:用費雪向量積(Fisher-vector product)加上共軛梯度近似搜尋方向,完全不必組出費雪矩陣,再以回溯線搜尋確保滿足 KL 約束並帶來真正的改善。其懲罰項版本附帶單調改善的下界保證。
TRPO 原理嚴謹,但屬二階方法且代價高昂。近端策略最佳化(PPO)是更便宜的一階後繼者,用截斷代理目標取代硬性 KL 約束,這也是 PPO 在實務上遠為常見的原因。
\max_{\theta}\ \mathbb{E}\!\left[\tfrac{\pi_\theta(a\mid s)}{\pi_{\theta_{\text{old}}}(a\mid s)}A^{\pi_{\text{old}}}(s,a)\right]\ \text{s.t.}\ \bar{D}_{\mathrm{KL}}(\pi_{\text{old}}\,\|\,\pi_\theta)\le\delta
在平均 KL 步幅不超過信賴域大小 delta 的前提下,最大化重要性加權的優勢。
TRPO 的單調改善保證是針對懲罰版目標成立;實務上的約束版以該保證換取可用的步長。
又稱
另見