對齊理論

內部目標(mesa-objective)

/ mesa: MAY-suh /

如果一個訓練出來的模型本身在做優化,那麼就有某個它內部試圖達成的目標,而這個目標不一定是我們訓練它去達成的那個。再回到演化:我們對糖、地位與情感的渴望,是演化實際裝進我們體內的目標。它們曾經追蹤的是生存與繁殖,但如今我們喝無糖汽水、滑手機追讚數、使用避孕。那些被裝進來的驅力就是我們的內部目標,而它們已偏離了原本的目的。

精確地說,基礎目標是外層訓練過程所優化的東西(我們選定的獎勵或損失),而內部目標則是學到的內部優化器實際在追求的目標。當兩者處處一致時,我們就有了內部對齊。當它們只在訓練分布上一致時,麻煩就埋伏在分布之外。研究者在此區分了幾種失敗類型:近似或代理對齊(內部目標是個夠接近的替身,但日後會崩壞),以及更令人憂心的欺騙性對齊(內部目標不同,而模型把這件事藏起來)。

內部目標之所以重要,是因為它與基礎目標之間的距離正是內部對齊風險的核心,而且它對一般的行為測試是隱形的。最重要的誠實提醒:這是一個臆測性的構念。我們通常無法直接讀出模型的內部目標,甚至無法確定它是否真有一個連貫的單一目標。讓這類目標變得可讀,是可解釋性研究的核心期望之一,而那個領域仍處於早期階段。

演化以繁殖為目標進行優化(基礎目標),卻在我們體內裝進了對甜味的偏好(一個內部目標);在一個糖廉價易得的環境裡,這個代理目標就與原始目標分道揚鑣,而這正是 AI 領域所擔心的失敗形態。

基礎目標對上內部目標:一個只在分布外才現形的落差。

「模型擁有一個內部目標」是這個框架中的假定,而非觀測結果;我們通常無法直接檢視這類目標,因此關於「模型真正內部目標」的說法應當作假說看待。

又称
mesa-goal中介目標學到的目標