「一步走壞」的問題
像 REINFORCE 演算法 這類原始策略梯度方法,遵循 策略梯度定理(policy-gradient theorem):把策略參數往能提高 期望回報(expected return) 的方向推。這個方向在局部是對的,但梯度完全沒告訴你能安全走多遠。步伐一大,新策略就可能落到舊資料從未描述過的區域——一次更新就足以摧毀一個訓練了好幾個小時的策略。
這在強化學習裡比在監督式學習裡更糟,原因有二。其一,資料分布本身取決於策略:策略一變,你造訪的狀態也跟著變,於是一次失誤會毒害你接下來要學習的樣本。其二,梯度估計很吵——居高不下的 策略梯度變異數(policy-gradient variance) 代表你信賴的那個方向,可能大半都是雜訊。
示意图:智能体在环境中采取动作并获得新状态与奖励,形成闭环。
替代目標函數
關鍵想法是:去最佳化一個真實回報的替身,而這個替身可以只用我們已經從舊策略蒐集到的資料來評估。這個 替代目標函數(surrogate objective) 用一個 重要性取樣(importance sampling) 比值對每個取樣動作重新加權——新策略對該動作的機率除以舊策略的——再乘上該動作的 優勢(advantage),也就是這個動作比平均好多少。
替代目标:用重要性比率乘以优势函数对旧策略采集的数据重新加权。
最大化這個替身,會把機率質量推向優勢為正的動作、推離優勢為負的動作——正是我們想要的。但有個陷阱:重要性比值只有在新策略與舊策略保持接近時才可信。一旦把策略推得太遠,那些比值就會爆炸,替身不再像真實回報,保證也隨之蒸發。這個「要接近」的約束,正是本軌每一個方法的種子。
單調改善保證
以下這個漂亮的結果,開啟了現代的紀元。我們可以證明:新策略的真實回報,至少等於替身的值減去一個懲罰項,而這個懲罰項正比於新策略偏離舊策略的程度(以某種分布距離衡量)。若你在保持該距離夠小的同時最大化替身,就得到 單調改善保證(monotonic improvement guarantee):每次更新都可證明不會使表現下降。
单调提升保证:新策略的真实回报至少等于替代值减去一个KL散度惩罚项。
這條階梯通往何方
- 第 2 篇——修正幾何:用自然梯度以正確方式衡量策略距離。
- 第 3 篇——TRPO 把那個保證變成一個你真能求解的硬性信賴域約束。
- 第 4 篇——PPO 丟掉硬求解器、改成裁剪比值,成為業界預設。
- 第 5 篇——大規模化、離線策略修正,以及 PPO 如何成為 RLHF 的核心。