JOVANA
Explore Library Glossary Getting Started Three Levels Fields How it works Mission
Join the mission
All guides

你寫不出來的那個獎勵

為什麼某些最重要的目標——要有幫助、要誠實、寫出好摘要——無法用手寫的獎勵函數捕捉,而人類回饋如何補上這一塊。

說得出口卻打不出分數的目標

標準強化學習(reinforcement learning)假設有人直接給你一個獎勵函數:一條把每個狀態與動作轉成數字的規則。對一場遊戲來說這很容易——分數就是獎勵。但假設目標是「把這篇文章摘要得好」或「回答得有幫助又誠實」。你看到好答案時認得出來,卻寫不出一條乾淨的公式去為每個可能的答案打分。這道鴻溝就是獎勵規格問題,也正是普通強化學習卡住的地方。

在标准强化学习中,环境每一步都会给智能体一个奖励——但对于'要有帮助'这类目标,根本没有这样一个数字可给。

智能体—环境循环图:智能体采取动作,环境返回新状态和奖励。

陷阱在於:你真的寫出來的任何公式都只是個代理(proxy)。獎勵「短的摘要」,模型就學會刪掉資訊;獎勵「含關鍵字的答案」,它就學會塞關鍵字。你能量到的東西,永遠不完全是你想要的東西。

改讓人來評判

基於人類回饋的強化學習(reinforcement learning from human feedback, RLHF)用人類判斷取代缺失的獎勵。我們不要求人給出精確的數字,而是把人放進訓練迴圈裡——這就是人在迴路的強化學習(human-in-the-loop RL)——讓他們說出比較喜歡哪種行為。這整個從判斷中學出策略的家族,就叫基於偏好的強化學習(preference-based RL)。

注意我們對人類的要求變了。我們不再要求「請用 1 到 10 分為這個打分」,而是改問一個容易得多的問題「這兩個哪個比較好?」。這一個設計選擇撐起了 RLHF 大部分的可靠度,值得單獨講一節。

比較勝過評分

蒐集人類意見有兩種方式。純量回饋(scalar feedback)要求評分者給一個絕對數字;比較式回饋(comparative feedback)只要求他們對選項排序。這個區別——純量式對比較式回饋——之所以重要,是因為人類給絕對數字時雜訊很大,給比較時卻校準得很好。你的「7/10」每天都在飄移,但你的「這個比那個好」卻穩定得驚人。

因此 RLHF 建立在偏好比較(preference comparisons)之上:給評分者看兩個候選行為,記錄他偏好哪一個。這裡的行為可以是單一答案,對控制問題來說則可以是一整條軌跡(trajectory)——一段隨時間展開的狀態與動作。無論哪種,原料都一樣:成對的樣本,加上一個指向贏家的大拇指。

P(A \succ B) = \sigma\!\left(r(A) - r(B)\right) = \frac{1}{1 + e^{-(r(A) - r(B))}}

Bradley–Terry 模型:评分者偏好 A 胜过 B 的概率,是两个行为奖励之差的 sigmoid。

RLHF 的三個動作

幾乎每個 RLHF 系統,從機器人到聊天模型,都是同樣三個動作依序執行。這就是 RLHF 配方,而本學習路徑接下來每個動作各一篇,外加一篇講它會怎麼壞掉。

  1. 蒐集偏好。從懂什麼叫好的人手上蒐集大量比較(下一篇)。
  2. 擬合獎勵模型。訓練一個模型來預測人類會偏好哪個行為,把比較重新變回一個可用的數字。
  3. 最佳化策略。用普通的強化學習去最大化那個學到的獎勵——同時待在起點附近,免得鑽它的盲點。
RLHF 的三步:收集人类偏好、训练奖励模型,再据此优化策略。

流程图:人类偏好数据训练奖励模型,奖励模型再训练策略。

如果你以前接觸過強化學習,那麼只有中間那個動作是新的:一個獎勵本身是訓練出來的模型,而非固定規則。如果你沒接觸過,別擔心——每個動作我們都先從直覺建起。