JOVANA
Explore Library Glossary Getting Started Three Levels Fields How it works Mission
Join the mission
All guides

為什麼策略梯度需要一條韁繩

原始策略梯度可能一步就毀掉一個好策略。認識替代目標函數,以及單調改善的承諾。

「一步走壞」的問題

REINFORCE 演算法 這類原始策略梯度方法,遵循 策略梯度定理(policy-gradient theorem):把策略參數往能提高 期望回報(expected return) 的方向推。這個方向在局部是對的,但梯度完全沒告訴你能安全走多遠。步伐一大,新策略就可能落到舊資料從未描述過的區域——一次更新就足以摧毀一個訓練了好幾個小時的策略。

這在強化學習裡比在監督式學習裡更糟,原因有二。其一,資料分布本身取決於策略:策略一變,你造訪的狀態也跟著變,於是一次失誤會毒害你接下來要學習的樣本。其二,梯度估計很吵——居高不下的 策略梯度變異數(policy-gradient variance) 代表你信賴的那個方向,可能大半都是雜訊。

智能體與環境的互動迴圈:由於策略決定動作,改變策略也會改變智能體所造訪的狀態。

示意圖:智能體在環境中採取動作並獲得新狀態與獎勵,形成閉環。

替代目標函數

關鍵想法是:去最佳化一個真實回報的替身,而這個替身可以只用我們已經從舊策略蒐集到的資料來評估。這個 替代目標函數(surrogate objective) 用一個 重要性取樣(importance sampling) 比值對每個取樣動作重新加權——新策略對該動作的機率除以舊策略的——再乘上該動作的 優勢(advantage),也就是這個動作比平均好多少。

L(\theta) = \mathbb{E}_{s,a\sim\pi_{\text{old}}}\!\left[\frac{\pi_\theta(a\mid s)}{\pi_{\text{old}}(a\mid s)}\,\hat{A}(s,a)\right]

替代目標:用重要性比率乘以優勢函數對舊策略採集的資料重新加權。

最大化這個替身,會把機率質量推向優勢為正的動作、推離優勢為負的動作——正是我們想要的。但有個陷阱:重要性比值只有在新策略與舊策略保持接近時才可信。一旦把策略推得太遠,那些比值就會爆炸,替身不再像真實回報,保證也隨之蒸發。這個「要接近」的約束,正是本軌每一個方法的種子。

單調改善保證

以下這個漂亮的結果,開啟了現代的紀元。我們可以證明:新策略的真實回報,至少等於替身的值減去一個懲罰項,而這個懲罰項正比於新策略偏離舊策略的程度(以某種分布距離衡量)。若你在保持該距離夠小的同時最大化替身,就得到 單調改善保證(monotonic improvement guarantee):每次更新都可證明不會使表現下降。

J(\pi_{\text{new}}) \;\ge\; L_{\pi_{\text{old}}}(\pi_{\text{new}}) \;-\; C\,\max_{s} D_{\mathrm{KL}}\!\big(\pi_{\text{old}}(\cdot\mid s)\,\|\,\pi_{\text{new}}(\cdot\mid s)\big)

單調提升保證:新策略的真實回報至少等於替代值減去一個KL散度懲罰項。

這條階梯通往何方

  1. 第 2 篇——修正幾何:用自然梯度以正確方式衡量策略距離。
  2. 第 3 篇——TRPO 把那個保證變成一個你真能求解的硬性信賴域約束。
  3. 第 4 篇——PPO 丟掉硬求解器、改成裁剪比值,成為業界預設。
  4. 第 5 篇——大規模化、離線策略修正,以及 PPO 如何成為 RLHF 的核心。