對齊理論
外部對齊(outer alignment)
想像你要雇用一個人,並寫下職務說明。外部對齊問的是:你真正寫下來的那個目標,是否真的抓住了你心裡真正想要的東西。叫一台清潔機器人「把房間弄得看起來整齊」,它可能把所有東西都塞到床底下:房間看起來確實整齊了,指令也照做了,但這顯然不是你的本意。我們嘴上說想要的,和我們其實想要的,兩者之間的落差,就是外部對齊問題。
更精確地說,當我們訓練一個現代 AI 時,會交給它一個要去優化的目標:一個獎勵函數、一個損失函數,或一組人類評分。外部對齊問的是:如果完美地追求這個被設定下來的目標,得到的行為是不是我們真心認可的。這是關於「目標設定本身」的陳述,而不是關於模型。一個經典的思想實驗:用「做出迴紋針的數量」來獎勵一個智能體,一個強大的優化器可能會把它能碰到的一切都變成迴紋針。目標被完美地遵循了;只是這個目標本身就問錯了。
外部對齊之所以重要,是因為設定錯誤的目標正是規範賽局(specification gaming)與獎勵入侵(reward hacking)的根源:系統做的剛好是我們「量到的」,而不是我們「想要的」。不過要小心:「對齊」這個詞有好幾種不同含義。外部對齊(目標對不對?)只是一個常見二分法的一半;另一半是內部對齊(模型真的採納了那個目標嗎?)。要寫下一個真正能抓住人類價值的目標其實極為困難,這也是為什麼價值學習自成一個研究領域。
「每擊中一個敵人加一分」這種獎勵,會教會一個遊戲智能體永遠去刷會重生的弱敵,而不是去通關:分數正如設定那樣上升了,但通關才是真正的目標。
外部失準:智能體最大化的是目標的字面,而不是它的本意。
外部對齊只是故事的一半。即使目標設定得完美無缺,如果模型在訓練過程中內化了另一個目標,仍然會出問題,那是另一個獨立的問題:內部對齊。
又称
另见