大型語言模型工程
IPO(恆等偏好最佳化,identity preference optimization)
DPO 的作法是把偏好資料集直接變成一個損失,但它從其邏輯斯形式繼承了一個隱藏假設:它把被選中與被拒絕答案之間隱含的獎勵差距,當成一個要被越推越大的東西。當一個配對總是被貼上同樣的標籤——也就是確定性或近乎確定性的偏好——那股壓力便永不止息,模型會把獎勵差距推向無窮,而那個本該把它留在參考模型附近的約束實質上蒸發,招來過度配適。
IPO 診斷出這一點,並用一個不同的目標函數來修補。它不用無界的邏輯斯損失,而是用平方損失,把隱含對數機率比的差迴歸向一個固定的有限邊距。由於目標是一個常數而非無窮,模型一旦讓被選中回應領先被拒絕回應達到那個設定邊距就心滿意足、停在那裡;而參考錨定的正則化即使面對完全一致的資料也仍抓得牢。它實質上就是「拿掉了失控的 DPO」。
實務上的解讀是:當偏好乾淨、稀疏、或強烈確定時,IPO 更穩健——這恰是 DPO 會悄悄過度配適的區制。代價是多一個超參數(邊距),以及一個事實:在雜訊多、量又大的偏好資料上,它與 DPO 的差異會縮小,因為那裡的邏輯斯損失本來就難有失控的機會。
\mathcal{L}_{\mathrm{IPO}} = \left(h_\theta(y_w,y_l) - \tfrac{1}{2\beta}\right)^2,\quad h_\theta = \log\frac{\pi_\theta(y_w)\,\pi_{\mathrm{ref}}(y_l)}{\pi_\theta(y_l)\,\pi_{\mathrm{ref}}(y_w)}
IPO 把對數比差迴歸到一個有限邊距 1/(2β),而非把它推向無窮。
IPO 不需要獨立的獎勵模型——和 DPO 一樣以參考錨定——它的修補純粹在損失的形狀上,把無界的 log-sigmoid 換成有界的平方邊距。
又称
另见