大型語言模型工程

獎勵模型訓練(reward model training)

人類對文字的偏好容易表達、卻不可能寫成一條公式,所以 RLHF 需要一個替身:一個學出來的模型,讀進一個提示與一個候選回應,輸出一個代表「它有多好」的單一純量分數。獎勵模型訓練建構的正是這個。它從一個語言模型出發,把預測詞元的頭換成一個純量輸出頭,並在一組人類比較資料上擬合它,使分數追蹤人們實際偏好的東西。

標準目標函數是 Bradley–Terry 的配對損失。對每個帶有「被選中」與「被拒絕」回應的提示,模型被訓練成讓被選中者得到較高分數——做法是在一個關於分數差的邏輯斯模型下,最大化「較佳答案勝出」的對數機率。關鍵是獎勵只有在相對意義下才有意義——絕對尺度是任意的——而模型學的是一個平滑的曲面,把人類判斷內插到任何標註者都沒排序過的輸出上。

這個學出來的獎勵接著驅動策略:PPO 對著它最佳化、best-of-N 用它對樣本重新排序、DPO 則隱式地把它烤進去。眾所周知的失敗是過度最佳化、或稱獎勵駭客——把策略對著一個不完美的代理推得太用力,它就會找到分數很高、卻不是人類想要的輸出。獎勵模型也會繼承標註者偏誤,並在策略偏離它訓練資料時失去校準。

\mathcal{L}_{\mathrm{RM}} = -\,\mathbb{E}_{(x,y_w,y_l)}\big[\log\sigma\big(r_\phi(x,y_w) - r_\phi(x,y_l)\big)\big]

Bradley–Terry 損失:訓練分數差,使偏好答案 y_w 的排名高於被拒絕的 y_l。

獎勵模型是代理、不是目標本身——它的分數只在貼近其訓練分佈的輸出上才可信,這正是為什麼無約束地對著它最佳化終會崩壞。

又称
reward modelpreference model獎勵模型