進階策略優化

單調改善保證(monotonic improvement guarantee)

策略優化的夢想,是一個永遠不會把事情變糟的更新規則——每個新策略都可證明至少和上一個一樣好。TRPO 背後的關鍵結果,原則上正好提供了這一點。它證明新策略的真實報酬,至少等於代理目標減去一個與新舊策略之間最大 KL 散度成正比的懲罰。代理目標是一個下界,且在當前策略處與真實目標相切。

由於這個界落在真值之下、又在當前點與真值相接,最大化這個界只可能把真實報酬往上推:這是一種「下界化—最大化」(minorization-maximization)的格式,和 EM 演算法是同一套邏輯。改善下界,實際表現便會跟上。實務上,理論的懲罰係數保守到若嚴格照辦只能走微乎其微的步,因此 TRPO 改用 KL 信賴域、PPO 改用裁剪——以滴水不漏的保證,換取大到能在合理時間內學會的步長。

J(\tilde\pi)\ \ge\ L_\pi(\tilde\pi)-C\,\max_s D_{\mathrm{KL}}\!\big(\pi(\cdot\mid s)\,\|\,\tilde\pi(\cdot\mid s)\big)

真實報酬以「代理目標減去 KL 懲罰」為下界。

又称
policy improvement boundminorization-maximization for policies