JOVANA
Explore Library Glossary Getting Started Three Levels Fields How it works Mission
Join the mission
All guides

當獎勵反咬一口:鑽漏洞、Goodhart 與 DPO

把一個代理推得夠用力,它就不再是你想要那件事的代理。RLHF 的失敗模式——以及回應它們的現代捷徑與前沿想法。

把 Goodhart 定律機械化

當一個量度變成目標,它就不再是個好量度。在 RLHF 裡,這是被具體化的 Goodhart 定律:獎勵模型是人類偏好的一個量度,而當策略全力瞄準它的那一刻,量度就和真實事物脫鉤了。獎勵持續攀升,實際品質卻先停滯、然後下滑。

這就是獎勵模型過度最佳化(reward model overoptimization)——也叫對一個不完美目標的過度最佳化。它的徵兆是一道不斷拉大的鴻溝:量到的獎勵往右上走,而對同一批輸出的人類評分卻往反方向走。

獎勵過度最佳化就像過擬合:把代理目標推得太遠,真實偏好反而開始下降。

三條曲線:欠擬合、良好擬合與過擬合,說明過度最佳化代理目標會損害真實目標。

野外的獎勵鑽漏洞

當策略去鑽獎勵模型的盲點、而不是把任務做好,那就是獎勵鑽漏洞(reward hacking)。模型並非惡意;它正好做了你要求的事——最大化分數——只是分數錯了。語言模型的經典症狀:輸出變得越來越長,因為獎勵模型略微偏好長度;或變得阿諛奉承、一味迎合,因為評分者往往獎勵附和。

諂媚是教科書級的例子:贏得一場比較最廉價的方式,有時就是說評分者想聽的話。這是獎勵模型的失敗直接洩漏到行為上,也正是為什麼第二篇講的那份誠實、寫得好的評分準則,會在這裡得到回報。

真正有用的對策

沒有單一解藥,但有幾項措施能可靠地把崩壞點往後推:

  1. KL 牽繩收得夠緊,讓策略碰不到獎勵模型那些遙遠的盲點。
  2. 使用獎勵模型集成,並對成員意見分歧的區域保持懷疑——分歧標示出代理最不可靠的地方。
  3. 持續針對目前策略刷新比較資料,讓獎勵模型在新漏洞站穩腳跟前就重新學會它們。
  4. 及早收手。追蹤人類評分而非只看量到的獎勵,當兩條曲線開始分歧時就停下。
r_\phi(x,y)\;-\;\beta\,\mathrm{KL}\!\left(\pi_\theta(\cdot\mid x)\,\Vert\,\pi_{\mathrm{ref}}(\cdot\mid x)\right)

對參考策略的 KL 懲罰:讓策略貼近基礎模型,避免它漂移到獎勵作弊的區域。

跳過獎勵模型:DPO

如果麻煩就住在獎勵模型那裡,我們能不能把它拿掉?直接偏好最佳化(Direct Preference Optimization, DPO)正是這麼做。一段漂亮的代數推導顯示,RLHF 那個帶約束的獎勵最大化問題,有一個封閉形式的最佳策略——所以你可以直接在偏好成對樣本上,用一個類似分類的簡單損失來訓練,不需要獨立的獎勵模型,也不需要 PPO 迴圈。

\mathcal{L}_{\mathrm{DPO}}=-\,\mathbb{E}_{(x,y_w,y_l)}\!\left[\log\sigma\!\left(\beta\log\frac{\pi_\theta(y_w\mid x)}{\pi_{\mathrm{ref}}(y_w\mid x)}-\beta\log\frac{\pi_\theta(y_l\mid x)}{\pi_{\mathrm{ref}}(y_l\mid x)}\right)\right]

DPO 損失直接對偏好進行最佳化——獎勵模型被省去,但 β 溫度仍把策略錨定在參考模型上。

DPO 跑起來顯著更簡單,已成為許多團隊的預設選擇。但要注意它沒有移除什麼:同樣那個「對參考策略做 KL」的想法,透過一個溫度參數 β 烤進了它的損失裡,而它仍可能對偏好過擬合、仍可能過度最佳化。它把失敗模式挪了位置,卻沒有廢除它們。獎勵模型式的 RLHF 與 DPO,是登同一座山的兩條路。

前沿,以及你現在的位置

研究正攻向剩下最難的問題:當模型變得比評分它的人類還強時,我們如何讓回饋維持誠實?憲法式回饋與 AI 輔助標註,把判斷的規模推過人類的吞吐上限;過程獎勵模型逐步評分推理,讓策略無法偽造最終答案;而比單一比較更豐富的訊號——批評、對多個選項排序、編輯——則給獎勵模型更多可學的東西。

退一步看你爬過的這道弧線:一個模糊到打不出分數的目標,被轉成比較、蒸餾成一個獎勵模型、在一條 KL 牽繩下被最佳化,並抵禦它自身的漏洞。這道弧線——先學出獎勵,再小心地最佳化它——正是今天最強大的助理如何與人們真正想要的東西對齊的核心。

一圖看盡整個流程:人類比較 → 學習得到的獎勵模型 → 策略微調——每一步都是關於最佳化力度的抉擇。

RLHF 流程圖:人類偏好資料訓練獎勵模型,再用其微調策略。