對齊與人類回饋強化學習(RLHF)

偏好優化方法(preference optimization methods)

一旦 DPO 證明了可以不靠 RL 迴圈、直接從偏好資料對齊模型,一整族相關的目標函數就跟著出現。它們共享一個目標——把被選中回覆推到被拒絕回覆之上,同時貼著參考模型——但在確切的損失上各有不同,而每一種都修補了別人被認為的弱點。

IPO 加了一項,限制模型對任何單一成對「用力」的程度,防範 DPO 在偏好近乎確定時可能出現的過擬合。KTO 則完全拋開成對資料:它從被單純標為「好」或「壞」的個別回覆學習,借用了展望理論(prospect theory)的想法,當真實世界的回饋是按讚與倒讚、而非乾淨比較時特別好用。ORPO 把偏好學習摺進監督式微調本身,省掉了獨立的參考模型。

沒有放諸四海的贏家。正確選擇取決於你的資料長什麼樣——成對或非成對、乾淨或吵雜、充裕或稀缺——也取決於你多擔心過度優化。共同的教訓是:RLHF 的好處,很大一部分可以用精心設計的離線目標函數捕捉到。

又稱
DPO, IPO, KTO and relativesoffline alignment objectives