對齊理論
迭代放大(iterated amplification)
一個人無法獨力回答一個龐大的研究問題,但一個懂得把問題拆成小塊、把每一塊交給助手、再把答案組合起來的人,就能處理遠比他獨力所能應付的更大的問題。現在再想像:訓練一個快速的模型去模仿這整個團隊,然後把這個更厲害的新模型的副本當成助手交給團隊,如此反覆。這個自我拉拔的循環,就是迭代放大的核心想法。
更精確地說,IDA(由 Paul Christiano 提出)交替進行兩個步驟。放大:把一個人類連同對當前模型的數次呼叫放在一起,用它們把一個難題分解成模型已經能處理的子問題,再把這些小塊組裝成對難題的答案,這是一個較慢、但更有能力的「人類加 AI」團隊。蒸餾:訓練一個新模型去模仿那個被放大的團隊,把速度找回來。如此反覆。關鍵在於,訓練信號永遠來自這些被放大的團隊,所以從來不需要任何人類獨力去評斷那個完整的難題。
迭代放大之所以重要,是因為它是針對可擴展監督的一個具體提案:一種讓「對齊的能力」成長到超越人類直接判斷之外、同時在每一步都把人類保留在迴路中的辦法。誠實的但書:它假設「把問題拆成小塊」會保住對齊(安全的部分能組合成安全的整體),也假設蒸餾這一步不會悄悄引入新的失準。它至今仍大多是一個研究提案,在大規模上的驗證有限。
要回答「這個一萬行的程式安全嗎?」,一個人類加上模型副本把它拆成一個個模組,每個子問題都用同一套流程回答,再把判斷結果組合起來,接著訓練一個更快的模型去模仿這整套流程。
分解、委派、重組、蒸餾,然後反覆。
IDA 建立在一個重大假設上:難題能被分解成一些小塊,而這些小塊的安全、正確答案能重新組合成一個安全、正確的整體。如果分解過程遺失或扭曲了本意,放大也可能把錯誤一併放大。
又稱
另見