從人類回饋學習——RLHF 與獎勵建模

Bradley-Terry 模型(the Bradley-Terry model)

/ BRAD-lee TERR-ee /

想想西洋棋的排名怎麼運作:每位棋手都有一個分數,兩人分數的差距能預測誰會贏。Bradley-Terry 模型就是把同樣的想法套用到任何一種比較上。它是一個簡單而經典的統計配方(源自 1950 年代),把一堆「A 勝過 B」的判斷,轉成每個選項的單一強度分數,使這些分數能解釋你觀察到的勝負。

規則如下。給每個項目一個隱藏強度 s。模型說:A 被偏好勝過 B 的機率,是兩者差值的邏輯斯(sigmoid)函數:p(A 勝 B) = 1 / (1 + e^-(s_A - s_B))。所以若兩個答案強度相等,機率就是 0.5(擲硬幣);若 A 強一分,A 大約有 73% 的機率勝出;強兩分,大約 88%。在 RLHF 裡訓練獎勵模型,本質上就是去選出這些強度 s(由神經網路算出),使這些預測機率最能吻合所蒐集到的人類比較。

這正是從雜亂的人類偏好通往驅動 RLHF 的數值獎勵之間,那座精確的數學橋樑,而同樣的邏輯斯形式也再次出現在直接偏好優化(DPO)裡。不過值得知道它的假設:Bradley-Terry 假定存在單一一致的尺度,並把每次比較視為獨立,因此當偏好真的不具遞移性(人們偏好 A 勝 B、B 勝 C,卻又 C 勝 A),或評分者之間系統性分歧時,它可能會失靈。這些數字是偏好的一個有用「模型」,而不是偏好的「定律」。

如果獎勵模型給答案 A 的強度是 2.0、給答案 B 的強度是 1.0,Bradley-Terry 就預測人類大約有 73% 的時候會偏好 A(1/(1+e^-1))。

Bradley-Terry 透過邏輯斯函數,把強度差距對應到勝出機率。

Bradley-Terry 假定偏好落在單一一致的尺度上且彼此獨立;真實的人類偏好可能不具遞移性或依情境而變,因此這個模型是有用的近似,而非字面上的真理。

又称
Bradley-Terry-Luce modelBT model