說得出口卻打不出分數的目標
標準強化學習(reinforcement learning)假設有人直接給你一個獎勵函數:一條把每個狀態與動作轉成數字的規則。對一場遊戲來說這很容易——分數就是獎勵。但假設目標是「把這篇文章摘要得好」或「回答得有幫助又誠實」。你看到好答案時認得出來,卻寫不出一條乾淨的公式去為每個可能的答案打分。這道鴻溝就是獎勵規格問題,也正是普通強化學習卡住的地方。
智能体—环境循环图:智能体采取动作,环境返回新状态和奖励。
陷阱在於:你真的寫出來的任何公式都只是個代理(proxy)。獎勵「短的摘要」,模型就學會刪掉資訊;獎勵「含關鍵字的答案」,它就學會塞關鍵字。你能量到的東西,永遠不完全是你想要的東西。
改讓人來評判
基於人類回饋的強化學習(reinforcement learning from human feedback, RLHF)用人類判斷取代缺失的獎勵。我們不要求人給出精確的數字,而是把人放進訓練迴圈裡——這就是人在迴路的強化學習(human-in-the-loop RL)——讓他們說出比較喜歡哪種行為。這整個從判斷中學出策略的家族,就叫基於偏好的強化學習(preference-based RL)。
注意我們對人類的要求變了。我們不再要求「請用 1 到 10 分為這個打分」,而是改問一個容易得多的問題「這兩個哪個比較好?」。這一個設計選擇撐起了 RLHF 大部分的可靠度,值得單獨講一節。
比較勝過評分
蒐集人類意見有兩種方式。純量回饋(scalar feedback)要求評分者給一個絕對數字;比較式回饋(comparative feedback)只要求他們對選項排序。這個區別——純量式對比較式回饋——之所以重要,是因為人類給絕對數字時雜訊很大,給比較時卻校準得很好。你的「7/10」每天都在飄移,但你的「這個比那個好」卻穩定得驚人。
因此 RLHF 建立在偏好比較(preference comparisons)之上:給評分者看兩個候選行為,記錄他偏好哪一個。這裡的行為可以是單一答案,對控制問題來說則可以是一整條軌跡(trajectory)——一段隨時間展開的狀態與動作。無論哪種,原料都一樣:成對的樣本,加上一個指向贏家的大拇指。
Bradley–Terry 模型:评分者偏好 A 胜过 B 的概率,是两个行为奖励之差的 sigmoid。
RLHF 的三個動作
幾乎每個 RLHF 系統,從機器人到聊天模型,都是同樣三個動作依序執行。這就是 RLHF 配方,而本學習路徑接下來每個動作各一篇,外加一篇講它會怎麼壞掉。
- 蒐集偏好。從懂什麼叫好的人手上蒐集大量比較(下一篇)。
- 擬合獎勵模型。訓練一個模型來預測人類會偏好哪個行為,把比較重新變回一個可用的數字。
- 最佳化策略。用普通的強化學習去最大化那個學到的獎勵——同時待在起點附近,免得鑽它的盲點。
流程图:人类偏好数据训练奖励模型,奖励模型再训练策略。
如果你以前接觸過強化學習,那麼只有中間那個動作是新的:一個獎勵本身是訓練出來的模型,而非固定規則。如果你沒接觸過,別擔心——每個動作我們都先從直覺建起。