JOVANA
Explore Library Glossary Getting Started Three Levels Fields How it works Mission
Join the mission
All guides

PPO 之後:大規模化、離線策略與對齊

當 PPO 遇上分散式行動者、過時資料、以及大型語言模型的對齊時,策略優化往哪裡去。

為什麼 PPO 不是終點

PPO 是 on-policy 的:它只從當前策略產生的資料中學習,學完就丟。當你跑上百個分散式行動者時,這很浪費,因為等它們的經驗送到學習器時,策略早已往前走,使資料變得略為 離線策略(off-policy)。PPO 也把運算笨拙地分給策略學習與價值學習。本軌的前沿,正是在修正這些低效。

PPO 是同策略的:每次更新只從當前策略剛剛在這個智能體–環境迴路中產生的新軌跡中學習。

強化學習回路示意圖:智能體執行動作,環境返回新的狀態和獎勵。

V-trace:大規模下的離線策略修正

大規模的行動者—學習器系統,產生經驗的速度遠快於任何單一學習器以 on-policy 方式所能消化。V-trace 就是讓這件事安全的離線策略修正。它用截斷重要性取樣 比值來重新加權自助式價值目標——對比值設上限,使少數嚴重偏離策略的樣本無法炸掉估計。這種截斷以受控的偏差,換取變異數的大幅下降,讓單一學習器能消化來自眾多行動者、略為過時的資料而不發散。

\rho_t=\min\!\left(\bar{\rho},\ \frac{\pi(a_t\mid s_t)}{\mu(a_t\mid s_t)}\right),\qquad c_t=\min\!\left(\bar{c},\ \frac{\pi(a_t\mid s_t)}{\mu(a_t\mid s_t)}\right)

V-trace 截斷學習策略 π 與行為策略 μ 之間的重要性權重:ρ̄ 限定價值函數收斂到何處,c̄ 則約束離策略修正的變異數。

分相位策略梯度

讓策略與價值函數共享一個網路能省參數,卻造成拉鋸:價值損失會扭曲策略所需的特徵,而你又不能更用力訓練價值頭,否則策略會對舊資料過擬合。分相位策略梯度(phasic policy gradient,PPG) 透過把訓練分成相位來化解。策略相位跑普通的 PPO 更新;接著週期性的輔助相位用許多 epoch 把價值知識蒸餾進共享表徵,同時用一個 KL 項錨住策略,使額外的價值訓練不會挪動它。

PPG 是現代思維的乾淨範例:保留 PPO 穩定的核心,但圍繞它重新設計訓練排程,讓每個樣本被使用更多次,又不破壞信賴域的直覺。

一個統御全局的模板

退一步看,整條軌道都坍縮成第 2 篇的 鏡像下降 模板:每個方法都在最大化某個替身的同時,懲罰或約束「偏離舊策略」的移動。自然梯度挑選度量;TRPO 把約束變硬;PPO-clip 用 min 來逼近它;PPO-penalty 與 V-trace 則調整散度的權重。把它們看成同一家族,正是讓你能發明下一個變體、而非死背上一個的關鍵。

\theta_{k+1}=\arg\max_{\theta}\;\mathbb{E}_{s,a\sim\pi_k}\!\left[\frac{\pi_\theta(a\mid s)}{\pi_k(a\mid s)}\,A^{\pi_k}(s,a)\right]-\lambda\,\mathrm{KL}\!\left(\pi_\theta\,\|\,\pi_k\right)

鏡像下降模板:這裡的每種方法都在最大化替代優勢的同時,用 KL 懲罰項讓新策略保持接近舊策略。

PPO 的實戰:對齊語言模型

PPO 生涯裡最大的意外,是它成了 基於人類回饋的強化學習(reinforcement learning from human feedback,RLHF) 背後的最佳化器。在 PPO-for-RLHF 流程中,語言模型就是策略,一個學到的獎勵模型為其輸出評分,PPO 去最大化那個獎勵——再加上一個關鍵成分:一個 對參考策略的 KL 懲罰(即原始的監督式模型)。那個懲罰正是第 4 篇的 PPO-penalty/鏡像下降項,再度現身,阻止模型漂移到那些「剛好被獎勵模型高估」的退化文字。

RLHF 把 PPO 變成對齊優化器:人類偏好訓練出獎勵模型,再用它來調優語言模型這一策略。

RLHF 流程:人類偏好比較餵給獎勵模型,獎勵模型提供 PPO 用來調優策略的信號。

這也是信賴域直覺在控制之外證明其價值之處:沒有那條 KL 韁繩,策略很快就會找到 獎勵模型過度最佳化——一種「鑽代理獎勵漏洞、人類評判卻變差」的文字。你學到的所有「讓更新保持接近」的道理,到頭來都是對抗同一種失敗的同一種防禦:別把替身信過了頭。