對齊與人類回饋強化學習(RLHF)
用於 RLHF 的 PPO(PPO for RLHF)
PPO 是與 RLHF 關係最密切的強化學習演算法。有了獎勵模型之後,你還得真的去改動語言模型,讓它產生獎勵模型喜歡的回覆。PPO 的做法是:從目前的模型取樣回覆、替它們打分,然後微調模型,使高分回覆更可能出現、低分回覆更不可能出現。
「近端(proximal)」是它關鍵的安全設計。每次更新都會被裁剪(clip),讓新策略無法在單一步驟內偏離舊策略太遠,這能避免吵雜的獎勵訊號把模型搞爆。除此之外,RLHF 還加上對原始微調模型的 KL 懲罰,使策略一邊被獎勵拉著走、一邊又被繫在合理的起點上。實際效果上,模型把自己先前的答案當成一個信賴區域(trust region)。
PPO 有效但笨重:它得同時操作四個模型(策略、參考、獎勵、價值),而且很難調。這個成本正是 DPO 這類更簡單替代方案會流行起來的一大原因。
又称
另见