對齊與人類回饋強化學習(RLHF)

DPO 與 RLHF 的比較(DPO vs RLHF)

直接偏好優化(direct preference optimization,DPO)是一條捷徑,不用強化學習那套機器,就能拿到 RLHF 大部分的成果。它的洞見是數學上的:帶 KL 懲罰的 RLHF 目標,其最佳策略可以直接用獎勵寫出來,於是你能把獎勵模型摺疊掉,把整件事變成在偏好成對資料上的單一監督式損失。沒有獨立的獎勵模型,也沒有取樣迴圈。

具體來說,DPO 訓練模型,使它對每一組成對資料都提高被選中回覆的機率、降低被拒絕回覆的機率,並以一個凍結的參考模型為基準來衡量。參考模型與一個隱含的 KL 項直接內建在損失裡,所以模型依然會貼著起點。結果是一套穩定、易於執行的流程,在常見基準上往往與以 PPO 為基礎的 RLHF 不相上下。

取捨是真實存在的。RLHF 能取樣全新的回覆、對自己的輸出拿到獎勵,這有助於探索;DPO 只看得到資料集裡固定的偏好成對。當資料太狹隘時,DPO 也可能以奇怪的方式漂移。誰勝出,取決於資料、預算,以及任務需要多少線上探索。

\mathcal{L}_{\text{DPO}} = -\,\mathbb{E}_{(x,y_w,y_l)}\!\left[\log\sigma\!\left(\beta\log\frac{\pi_\theta(y_w\mid x)}{\pi_{\text{ref}}(y_w\mid x)} - \beta\log\frac{\pi_\theta(y_l\mid x)}{\pi_{\text{ref}}(y_l\mid x)}\right)\right]

DPO 的損失直接把被選中回覆 y_w 抬升到被拒絕回覆 y_l 之上,參考模型與 KL 係數 beta 都內建其中。

又称
direct preference optimizationRL-free preference tuning