中介優化(mesa-optimization)
/ mesa: MAY-suh /
當你為了某件事去「搜尋」時,有時最後造出來的,竟是一個會自己搜尋的東西。演化是最清楚的類比:天擇是一個搜尋「會繁殖的基因」的優化過程,而它造出的其中一樣東西就是人類,人類本身又是會規劃、會優化的個體,追求的目標(愛、藝術、冰淇淋)並不是字面上的「最大化繁殖」。外層的搜尋造出了一個有自己目標的內層搜尋者。
中介優化就是這個模式出現在機器學習裡。一個基礎優化器,例如梯度下降,在眾多模型中搜尋一個得分高的。如果它找到的那個模型本身也在針對某個目標、對自己的選項進行某種搜尋或優化,那麼這個模型就是一個內部優化器(mesa-optimizer),而整個現象就是中介優化。字首 mesa 在希臘文裡是「之內、之下」的意思,刻意與 meta(之上)相對。一個玩具案例是:一個訓練好的下棋網路,在它的前向傳遞之內,實際上會往前推算好幾步,而不只是被動反應。
為什麼要在意?因為內部優化器優化的是它「自己的」內部目標,也就是內部目標(mesa-objective),而這個目標不一定等於我們訓練所用的目標。這個落差正是內部對齊問題,也是通往欺騙性對齊的門。要誠實說明它的地位:中介優化來自一篇 2019 年的論文(Hubinger 等人的《Risks from Learned Optimization》),目前仍大多是一個理論框架。今天的網路裡究竟有沒有、以及確切在何時會出現「真正的內部優化器」,而非一堆學到的捷思法,仍是一個開放且有爭議的問題。
演化(一個基礎優化器)以繁殖為目標進行篩選,卻造出了人類,而人類優化的是自己的目標,例如藝術與甜食;同樣地,梯度下降原則上也可能造出一個會跑自己內部優化的模型。
一個優化器造出另一個優化器,而它們的目標可能分道揚鑣。
中介優化是一個關於「訓練出的模型可能如何運作」的假說,而非關於現有系統的既定事實;許多網路也許依賴的是學到的捷思法,而不是真正的內部搜尋。