進階策略優化
近端策略優化(proximal policy optimization, PPO)
PPO 是 TRPO 講求實用的弟弟:它想要同樣的安全感——別離產生資料的那個策略太遠——但不必每一步都去解一個帶約束的二階問題。它改成把這份謹慎直接寫進損失裡。你照樣算出新舊動作機率之比、乘上優勢,但接著把比率裁剪起來,使得把它推得遠遠超過一不再對目標有幫助。如此一來,優化器根本沒有誘因去走魯莽的一步。
由於裁剪後的損失只是一個普通函數,可以用一般的隨機梯度下降來優化,PPO 會在每一批蒐集到的經驗上跑好幾個 epoch 的小批次更新,然後把資料丟掉、再去蒐集新的軌跡。這個組合——裁剪式代理目標、多次便宜的更新、加上用廣義優勢估計(generalized advantage estimation)當目標——讓 PPO 簡單、對超參數穩健、又容易平行化。它因此成為深度強化學習中預設的同策略演算法,也是語言模型 RLHF 背後的主力。
L^{\text{CLIP}}(\theta)=\mathbb{E}_t\!\big[\min\big(r_t(\theta)\,A_t,\ \operatorname{clip}(r_t(\theta),1-\epsilon,1+\epsilon)\,A_t\big)\big]
PPO 取「原始」與「裁剪後」優勢加權比率中較小者來最大化。
又称
另见