基於人類回饋的強化學習

Bradley–Terry 模型(Bradley–Terry model)

假設每個選項都有一個隱藏的「強度」——棋手的棋力、答案的品質。Bradley-Terry 模型是一條簡單、有百年歷史的規則,把這些隱藏強度轉成「一方在對決中勝過另一方」的機率。強度差距越大,預期結果越一面倒;強度相等就是擲硬幣。它是從「每樣東西有多好」通往「人會挑哪一個」的橋樑。

替每個項目指派一個實數分數 s_i。Bradley-Terry 說 i 被偏好於 j 的機率,是兩者差的羅吉斯函數 σ(s_i − s_j)。在 RLHF 裡,那些分數恰恰就是獎勵模型的輸出,所以把獎勵模型配適到人類比較,就是在這個模型下做最大似然估計——這正是為什麼標準的獎勵損失,是對分數差的 sigmoid 交叉熵。整個「偏好轉獎勵」的步驟,都建立在這一個假設上。

這個模型假設偏好是遞移的、且在隨機意義下一致——也就是單一純量強度能解釋每一次比較。真實的人類偏好會以循環、情境效應、以及單純就是意見相左的評分者違反它,所以 Bradley-Terry 是個易處理又有用的近似,而非真相。它也只能定出分數的「差」:沒有絕對的零點,所以它產生的獎勵,只在相差一個常數平移的意義下才有意義。

P(i\succ j)=\sigma(s_i-s_j)=\frac{1}{1+e^{-(s_i-s_j)}}

i 勝過 j 的機率,是兩者分數差的羅吉斯函數。

又称
Bradley–Terry–Luce model