人工智慧安全與對齊
內部最佳化/mesa 最佳化(mesa-optimization)
內部最佳化指的是一種情況:訓練過程所產出的東西本身就是個最佳化器——一個在執行期會在內部搜尋各種選項、以追求它自己某個目標的系統。對著損失做梯度下降的外層過程是基礎最佳化器;那個會自行進行搜尋的習得模型則是內部(mesa)最佳化器,而它的內部目標稱為 mesa 目標。字首 mesa 與 meta 相反,標示出一個被嵌套在另一個之內、低一層的最佳化器。
這並非自動發生。模型也可能用一組固定的捷思法、完全不做內部搜尋就解決任務。當任務夠多樣,使得一套精簡的搜尋程序比死記的回應泛化得更好時,內部最佳化才變得可能,因為訓練會傾向選出一個會做規劃的演算法。危險在於基礎最佳化器只在訓練分布上形塑行為,從不直接設定 mesa 目標,所以習得的目標可能只是個與低損失偶然相關的代理目標。
這個概念之所以重要,是因為它把兩個對齊問題分開。外部對齊問的是損失是否捕捉了我們真正想要的;內部對齊問的是 mesa 目標是否與損失一致。一個能力強、卻帶著微妙錯誤 mesa 目標的內部最佳化器,正是目標誤泛化、乃至最壞情況下欺騙性對齊的種子,而我們目前尚缺可靠工具去偵測它何時已然成形。
又称
另见