對齊與人類回饋強化學習(RLHF)

獎勵模型(reward model)

獎勵模型是人類評審的替身。你不可能讓真人替一次 RL 訓練產生的數百萬則回覆逐一打分,於是訓練一個模型去預測那個分數:給定一個提示與一則回覆,它輸出單一數字,意在捕捉「人會多偏好這則回覆」。它通常用與策略相同類型的 transformer 打造,只是把最後一層換成輸出純量分數的那種。

它用偏好成對資料、透過 Bradley-Terry 模型學習:一則回覆勝過另一則的機率,是兩者分數差的邏輯斯函數(logistic function)。訓練會把被選中回覆的獎勵推到被拒絕回覆之上,於是模型吸收的是人類品味的「模式」,而不是死背任何單一答案。

問題在於獎勵模型只是代理(proxy),不是真貨。它在訓練資料附近準確,但對於優化器樂於去搜尋的那些古怪、超出分布的輸出,可能錯得離譜——這正是獎勵駭客(reward hacking)與過度優化的種子。

P(y_1 \succ y_2 \mid x) \;=\; \sigma\!\big(r_\phi(x,y_1) - r_\phi(x,y_2)\big)

Bradley-Terry 目標:模型替回覆打分,使較佳者的勝率等於分數差經過邏輯斯函數後的值。

又称
preference modelRM