為什麼 PPO 不是終點
PPO 是 on-policy 的:它只從當前策略產生的資料中學習,學完就丟。當你跑上百個分散式行動者時,這很浪費,因為等它們的經驗送到學習器時,策略早已往前走,使資料變得略為 離線策略(off-policy)。PPO 也把運算笨拙地分給策略學習與價值學習。本軌的前沿,正是在修正這些低效。
强化学习回路示意图:智能体执行动作,环境返回新的状态和奖励。
V-trace:大規模下的離線策略修正
大規模的行動者—學習器系統,產生經驗的速度遠快於任何單一學習器以 on-policy 方式所能消化。V-trace 就是讓這件事安全的離線策略修正。它用截斷的 重要性取樣 比值來重新加權自助式價值目標——對比值設上限,使少數嚴重偏離策略的樣本無法炸掉估計。這種截斷以受控的偏差,換取變異數的大幅下降,讓單一學習器能消化來自眾多行動者、略為過時的資料而不發散。
V-trace 截断学习策略 π 与行为策略 μ 之间的重要性权重:ρ̄ 限定价值函数收敛到何处,c̄ 则约束离策略修正的方差。
分相位策略梯度
讓策略與價值函數共享一個網路能省參數,卻造成拉鋸:價值損失會扭曲策略所需的特徵,而你又不能更用力訓練價值頭,否則策略會對舊資料過擬合。分相位策略梯度(phasic policy gradient,PPG) 透過把訓練分成相位來化解。策略相位跑普通的 PPO 更新;接著週期性的輔助相位用許多 epoch 把價值知識蒸餾進共享表徵,同時用一個 KL 項錨住策略,使額外的價值訓練不會挪動它。
PPG 是現代思維的乾淨範例:保留 PPO 穩定的核心,但圍繞它重新設計訓練排程,讓每個樣本被使用更多次,又不破壞信賴域的直覺。
一個統御全局的模板
退一步看,整條軌道都坍縮成第 2 篇的 鏡像下降 模板:每個方法都在最大化某個替身的同時,懲罰或約束「偏離舊策略」的移動。自然梯度挑選度量;TRPO 把約束變硬;PPO-clip 用 min 來逼近它;PPO-penalty 與 V-trace 則調整散度的權重。把它們看成同一家族,正是讓你能發明下一個變體、而非死背上一個的關鍵。
镜像下降模板:这里的每种方法都在最大化替代优势的同时,用 KL 惩罚项让新策略保持接近旧策略。
PPO 的實戰:對齊語言模型
PPO 生涯裡最大的意外,是它成了 基於人類回饋的強化學習(reinforcement learning from human feedback,RLHF) 背後的最佳化器。在 PPO-for-RLHF 流程中,語言模型就是策略,一個學到的獎勵模型為其輸出評分,PPO 去最大化那個獎勵——再加上一個關鍵成分:一個 對參考策略的 KL 懲罰(即原始的監督式模型)。那個懲罰正是第 4 篇的 PPO-penalty/鏡像下降項,再度現身,阻止模型漂移到那些「剛好被獎勵模型高估」的退化文字。
RLHF 流程:人类偏好比较喂给奖励模型,奖励模型提供 PPO 用来调优策略的信号。
這也是信賴域直覺在控制之外證明其價值之處:沒有那條 KL 韁繩,策略很快就會找到 獎勵模型過度最佳化——一種「鑽代理獎勵漏洞、人類評判卻變差」的文字。你學到的所有「讓更新保持接近」的道理,到頭來都是對抗同一種失敗的同一種防禦:別把替身信過了頭。