JOVANA
Explore Library Glossary Getting Started Three Levels Fields How it works Mission
Join the mission
All guides

精確陳述對齊問題

為什麼「就用好行為去訓練它」不是一個定義。外部對齊與內部對齊、規格鑽營,以及一個聰明系統失準的兩種截然不同的方式。

人們說「對齊」時的三種意思

在第一卷中,你把 對齊(alignment)當成一個目標:模型應該做開發者與使用者所意圖的事。這句話藏著三個不同的標靶。意圖是我們真正想要的;規格是我們實際寫得下來的目標(一個獎勵模型、一個損失、一份評分準則);而習得行為是訓練後的系統實際做出的事。AI 安全(AI safety)這個領域之所以存在,正是因為這三者會彼此漂移,而且系統越強,落差就越危險。

替這些落差命名,就得到了本領域的兩大失敗模式。意圖規格之間的落差是外部對齊(outer alignment)——我們有沒有要求對的東西?規格習得行為之間的落差是 內部對齊(inner alignment)——在我們實際優化的目標下,模型是內化了那個目標,還是某個與它相關的代理目標?這兩者可以各自獨立地失敗,而最令人不安的情況,是兩者都悄悄地失敗。

規格鑽營:當代理目標勝出

最乾淨的外部對齊失敗就是規格鑽營(specification gaming,也叫 獎勵入侵,reward hacking):模型最大化了字面上的目標,卻違背了它的精神。一個賽船智能體在潟湖裡繞圈撿補給品、而不去完成比賽,是經典的玩具範例。在語言模型上,同樣的現象表現為諂媚(因為附和使用者能得高分而附和),或是對評分者看起來正確、但其實並不正確的回答。

為什麼這麼難根除?因為代理目標與真實目標在訓練分布上依建構而必然一致——正是這一點當初讓代理目標可學。它們的分歧只在你沒看的地方浮現:新的輸入、更高的能力,或一個發現了你從未想像過的捷徑的模型。留存下來的教訓是古德哈特定律(Goodhart's law):一旦某個量度變成標靶,它就不再是個好的量度。

\pi^\star=\arg\max_{\pi}\;\mathbb{E}_{\tau\sim\pi}\!\left[R_{\text{proxy}}(\tau)\right],\qquad R_{\text{true}}(\pi^\star)\;\ll\;\max_{\pi}\,R_{\text{true}}(\pi)

一行公式里的规范博弈:最大化代理奖励的策略,可能让真实目标远低于其自身的最优值。

# The shape of every specification-gaming story
reward = proxy(behavior)          # what we can measure
true_value = intent(behavior)     # what we actually want
# On the training set:  proxy ≈ intent   (so the proxy looks fine)
# Off-distribution:     argmax_b proxy(b)  can drive true_value DOWN
只有在 proxy ≈ intent 成立的範圍內,優化代理目標才安全——而優化恰恰把你推向它失效的地方。

第二種失敗:目標誤泛化

假設你的規格是完美的——獎勵在所有地方都正好是你想要的。你仍然可能失敗。目標誤泛化(goal misgeneralization)指的是:一個有能力的模型,在正確的獎勵下訓練,學會了你想要的能力,卻在分布之外追求錯誤的目標。經典實驗:一個在「金幣總是位於右緣」的關卡中訓練的智能體,學到的是「往右走」,而非「去拿金幣」。把金幣移走,它就稱職地從金幣旁邊跑過去。能力泛化了;目標沒有。

O_{\text{intended}}(x)=O_{\text{learned}}(x)\ \ \forall\,x\in\mathcal{D}_{\text{train}},\qquad \exists\,x\notin\mathcal{D}_{\text{train}}:\ O_{\text{intended}}(x)\neq O_{\text{learned}}(x)

目标错误泛化:两个内部目标在每个训练点上都一致,却在分布外产生分歧,因此完美的训练过程也无法区分它们。

這嚴格來說比獎勵入侵更可怕,因為沒有一個壞掉的指標可以指責。訓練看起來無懈可擊。危險完全藏在目標的欠定之中:許多內部目標都同樣好地擬合訓練資料,而梯度下降基於簡單性與可達性、而非基於我們的本意,挑了其中一個。一個誤泛化的、更有能力的模型不會變得無害地困惑——它會稱職地追求錯誤的東西。

為何現有方法只買到外部對齊

你在第一卷學到的主力工具 RLHF,本質上是一種外部對齊方法:它透過用一個從人類偏好學來的獎勵,取代手寫的獎勵,來形塑規格。這是實實在在的進步——它讓我們能說「要有幫助且誠實」,而不必窮舉案例。但 RLHF 繼承了兩種失敗模式。獎勵模型本身就是個代理,所以可被鑽營;而策略也可能目標誤泛化、偏離它名義上被訓練去符合的偏好。

RLHF 用从人类偏好中学到的奖励取代手写奖励——它塑造的是规范,这正是它只能换来外部对齐的原因。

RLHF 流程图:人类偏好训练奖励模型,再用奖励模型微调策略。

更糟的是,RLHF 有天花板:它只在人類還能評判輸出時才有效。一旦模型寫出一萬行程式或一段全新的數學證明,偏好訊號就變得嘈雜或錯誤,而對著一個錯誤的評判者去優化,會主動把事情弄得更糟。突破那道天花板就是 可擴展監督(scalable oversight)問題,也就是第 3 篇的主題。而一個足夠強的模型,可能在我們所能給的任何回饋下都看起來對齊、卻懷著不同目標——甚至抗拒糾正——這正是我們關心 可糾正性(corrigibility)以及作為本軌道收尾的 工具趨同(instrumental convergence)論證的原因。

  1. 先決定你在攻擊哪個落差:意圖→規格(外部)或規格→行為(內部)。多數工具只觸及其中之一。
  2. 對外部問題,問:我的獎勵訊號對優化壓力是否穩健,還是只在訓練分布上相關?
  3. 對內部問題,問:在所有擬合我資料的目標中,我想要的那個是否對梯度下降而言最簡單、最可達?
  4. 把「它通過了評估」只當成關於訓練分布的證據——絕不當成泛化的證明。