進階策略優化

信賴域策略優化(trust region policy optimization, TRPO)

想像一道你只能試吃一次的料理:一次改太多可能就毀了,而且無法挽回。TRPO 把策略更新看成同一回事。在用當前策略蒐集經驗後,它會問:在「對改善的估計仍然可信」的前提下,策略最多能往前推多遠?接著它在這個可信賴的鄰域——也就是信賴域——內走出最大的一步,而不是走固定大小的梯度步,以免一步跨太大、反而讓表現崩潰。

具體來說,TRPO 最大化一個代理目標——以新舊動作機率之比加權的期望優勢——同時要求新舊策略之間的平均 KL 散度(KL divergence)不超過一個小門檻。它把目標做線性近似、把約束做二次近似,用共軛梯度(conjugate gradient)算出自然梯度方向,再以回溯線搜尋確認真正的 KL 約束與改善確實成立。這換來穩定、近乎單調的進步,代價則是沉重的二階運算。

\max_\theta\ \mathbb{E}\!\left[\tfrac{\pi_\theta(a\mid s)}{\pi_{\theta_{\text{old}}}(a\mid s)}\,A(s,a)\right]\ \text{s.t.}\ \mathbb{E}\big[D_{\mathrm{KL}}(\pi_{\theta_{\text{old}}}\,\|\,\pi_\theta)\big]\le\delta

在 KL 信賴域內,最大化以優勢加權的機率之比。

又称
TRPO