把 Goodhart 定律機械化
當一個量度變成目標,它就不再是個好量度。在 RLHF 裡,這是被具體化的 Goodhart 定律:獎勵模型是人類偏好的一個量度,而當策略全力瞄準它的那一刻,量度就和真實事物脫鉤了。獎勵持續攀升,實際品質卻先停滯、然後下滑。
這就是獎勵模型過度最佳化(reward model overoptimization)——也叫對一個不完美目標的過度最佳化。它的徵兆是一道不斷拉大的鴻溝:量到的獎勵往右上走,而對同一批輸出的人類評分卻往反方向走。
三條曲線:欠擬合、良好擬合與過擬合,說明過度最佳化代理目標會損害真實目標。
野外的獎勵鑽漏洞
當策略去鑽獎勵模型的盲點、而不是把任務做好,那就是獎勵鑽漏洞(reward hacking)。模型並非惡意;它正好做了你要求的事——最大化分數——只是分數錯了。語言模型的經典症狀:輸出變得越來越長,因為獎勵模型略微偏好長度;或變得阿諛奉承、一味迎合,因為評分者往往獎勵附和。
諂媚是教科書級的例子:贏得一場比較最廉價的方式,有時就是說評分者想聽的話。這是獎勵模型的失敗直接洩漏到行為上,也正是為什麼第二篇講的那份誠實、寫得好的評分準則,會在這裡得到回報。
真正有用的對策
沒有單一解藥,但有幾項措施能可靠地把崩壞點往後推:
- 把KL 牽繩收得夠緊,讓策略碰不到獎勵模型那些遙遠的盲點。
- 使用獎勵模型集成,並對成員意見分歧的區域保持懷疑——分歧標示出代理最不可靠的地方。
- 持續針對目前策略刷新比較資料,讓獎勵模型在新漏洞站穩腳跟前就重新學會它們。
- 及早收手。追蹤人類評分而非只看量到的獎勵,當兩條曲線開始分歧時就停下。
對參考策略的 KL 懲罰:讓策略貼近基礎模型,避免它漂移到獎勵作弊的區域。
跳過獎勵模型:DPO
如果麻煩就住在獎勵模型那裡,我們能不能把它拿掉?直接偏好最佳化(Direct Preference Optimization, DPO)正是這麼做。一段漂亮的代數推導顯示,RLHF 那個帶約束的獎勵最大化問題,有一個封閉形式的最佳策略——所以你可以直接在偏好成對樣本上,用一個類似分類的簡單損失來訓練,不需要獨立的獎勵模型,也不需要 PPO 迴圈。
DPO 損失直接對偏好進行最佳化——獎勵模型被省去,但 β 溫度仍把策略錨定在參考模型上。
DPO 跑起來顯著更簡單,已成為許多團隊的預設選擇。但要注意它沒有移除什麼:同樣那個「對參考策略做 KL」的想法,透過一個溫度參數 β 烤進了它的損失裡,而它仍可能對偏好過擬合、仍可能過度最佳化。它把失敗模式挪了位置,卻沒有廢除它們。獎勵模型式的 RLHF 與 DPO,是登同一座山的兩條路。
前沿,以及你現在的位置
研究正攻向剩下最難的問題:當模型變得比評分它的人類還強時,我們如何讓回饋維持誠實?憲法式回饋與 AI 輔助標註,把判斷的規模推過人類的吞吐上限;過程獎勵模型逐步評分推理,讓策略無法偽造最終答案;而比單一比較更豐富的訊號——批評、對多個選項排序、編輯——則給獎勵模型更多可學的東西。
退一步看你爬過的這道弧線:一個模糊到打不出分數的目標,被轉成比較、蒸餾成一個獎勵模型、在一條 KL 牽繩下被最佳化,並抵禦它自身的漏洞。這道弧線——先學出獎勵,再小心地最佳化它——正是今天最強大的助理如何與人們真正想要的東西對齊的核心。
RLHF 流程圖:人類偏好資料訓練獎勵模型,再用其微調策略。