進階策略優化

KL 約束的策略更新(KL-constrained policy update)

當你用舊策略蒐集到的資料去改善策略時,你的估計只有在舊策略附近才可信。KL 約束的更新直接落實這一點:你想把報酬拉多高都行,但要讓新舊動作分佈之間的 KL 散度(Kullback–Leibler divergence)維持在一個預算之內。KL 在這裡是很自然的尺,因為它量的是兩個策略在你實際走過的狀態上行為差多少,而不只是參數移動了多遠。

落實這個預算有兩種方式。硬約束,如 TRPO,會解一個帶約束的最佳化問題,使平均 KL 永遠不超過門檻。軟約束則加上一個懲罰項,從目標中減去「係數乘以 KL」,於是較大的散度會被勸阻、但並未被禁止。無論哪種,這條 KL 牽繩都把原始、高變異的策略梯度,轉化為穩定且樣本高效的進步;同樣的想法也出現在 RLHF 中,讓模型貼著參考模型不要走遠,可防止獎勵入侵。

\max_\theta\ \mathbb{E}[A]\quad\text{s.t.}\quad \mathbb{E}\big[D_{\mathrm{KL}}(\pi_{\theta_{\text{old}}}\|\pi_\theta)\big]\le\delta\qquad\text{or}\qquad \max_\theta\ \mathbb{E}[A]-\beta\,D_{\mathrm{KL}}

同一條牽繩,可以是硬約束(左)或軟懲罰(右)。

又称
KL trust regionKL-constrained update