從人類回饋學習——RLHF 與獎勵建模

古德哈特定律(Goodhart's law)

/ GOOD-hart /

當一所學校只用考試成績來評斷時,老師就會開始「為考試而教」:分數上去了,真正的學習卻未必。一旦某個人們在乎的數字成了官方目標,人們就會去優化那個數字,而不是它原本該代表的東西。這一句話,就是古德哈特定律,得名自英國經濟學家查爾斯·古德哈特(Charles Goodhart),他在 1975 年針對貨幣政策提出此觀察。常見的說法是:當一個量度變成目標,它就不再是一個好的量度。

陷阱在於:幾乎每一個量度都是代理,是我們真正在乎、卻無法直接量測之物的方便替身。只要你「只是觀察」這個代理,它的相關性都還不錯。但一旦你「用力去最大化」它,代理與目標之間的空隙就成了漏洞。用「釘子數量」獎勵一家工廠,它就做出數千根又小又沒用的釘子;改用「總重量」獎勵,它就做出幾根又大又沒用的釘子。惡名昭彰的殖民地眼鏡蛇懸賞,導致人們為了賞金而養殖眼鏡蛇。量度達標了,目的卻落空了。

古德哈特定律大概是理解「為什麼對齊 AI 這麼難」最重要的單一觀念。在 RLHF 裡,獎勵模型是人類偏好的一個被量出來的代理,因此把策略拿去對它優化,等於是直接向古德哈特招手,表現出來就是獎勵過度優化與獎勵入侵。同樣的邏輯也支撐著整個 AI 安全領域的規範賽局:任何我們寫得出來的目標,都是我們真正想要之物的代理,而一個能力足夠強的優化器,終會找到那道空隙。與其說它是自然定律,不如說它是「優化遇上不完美量度」時近乎必然的模式。

一間以「通話時間短」為獎勵的客服中心,員工開始直接掛斷客戶電話:指標(通話長度)改善了,目的(幫助客戶)卻變糟了,這是一個完美的古德哈特循環。

把代理優化得夠用力,它就不再追蹤它原本代表的目標。

古德哈特定律是一種模式,不是必然;溫和的優化、或難以被鑽漏洞的量度,仍可保持可靠。危險特別來自「用力優化一個代理」,而這正是 RL 微調在做的事。

又稱
Goodhart's principle古德哈特法則