進階策略優化

PPO 裁剪法與懲罰法之比較(PPO clip vs. penalty)

PPO 一開始就有兩種版本,追求同一個目標——讓新策略貼近舊策略——卻用不同手段。PPO-Clip 用隱含方式拉牽繩:它裁剪機率之比,使代理目標不再獎勵超出「一」附近帶子的移動,整個過程完全沒有顯式的 KL 項。PPO-Penalty 則用顯式方式:它從目標中減去「係數乘以 KL 散度」,再把這個係數上下調整,以命中一個目標 KL。

在原始實驗中,裁剪版大致追平或勝過懲罰版,又更簡單——少一樣要調的東西、沒有需要維護的 KL 係數——因此成為大家口中預設的 PPO。懲罰版在你想精準控制散度、而非只是設個上界時仍有用,例如在 RLHF 中,維持與參考模型之間一個選定的 KL,是在獎勵與「忠於基礎策略」之間做權衡。有些系統甚至把裁剪和顯式 KL 懲罰一起用,以求額外的穩定。

又称
PPO-Clip vs PPO-Penaltyclip vs adaptive-KL