可解釋性

機制可解釋性(mechanistic interpretability)

一個訓練好的神經網路,有點像是從夜間飛機上俯瞰的巨大城市:數百萬盞燈(也就是數字)依照某種模式閃爍,而它在某個地方學會了翻譯法文或寫程式——但你看不出它究竟是怎麼辦到的。機制可解釋性這項工作,就是要把飛機降落、走進街道,弄清楚每一棟建築實際上在做什麼。它試圖把藏在模型權重裡的運算逆向工程出來,還原成人類可以命名、可以畫出、可以查核的零件。

「機制」這個詞表示:你不滿足於知道模型很準確,你想要的是它在內部真正執行的演算法。研究者的做法是研究模型的內部激活(也就是它處理一句話時流經內部的數字),假設這團活動中的某個方向代表一個對人類有意義的概念——也就是特徵——而這些特徵又連接成小型的運算子圖——也就是電路。舉一個真實例子:研究者在 Transformer 中找到了稱為歸納頭(induction head)的小元件,它執行一條具體規則:一旦看過「A 接著 B」這個模式,當 A 再次出現時,就預測 B。這是一個你真的可以指出來的「複製模式」演算法。

這對 AI 安全很重要,因為行為測試只能告訴你模型在你剛好試過的那些情況下做了什麼;而機制可以告訴你它為什麼那樣做,並且有機會在傷害發生之前,揭露一條隱藏的捷徑、一個脆弱的經驗法則,甚至是一個被掩蓋的目標。但這個領域還很年輕,也令人謙卑。內部零件是糾纏在一起的——一個神經元可能參與許多互不相關的運算——而一個整齊的解釋,可能只是恰好符合觀測,卻不是真正的機制。今天的機制可解釋性,最好被理解為一批快速累積的部分成果,而不是一台已經完工的顯微鏡。

給定文字「Harry Potter … Harry」,Transformer 會穩定地接上「Potter」。透過追蹤是哪些內部注意力頭造成了這個結果,研究者辨識出歸納頭,它實作的規則是「找到這個詞先前出現的地方,並複製它後面接的東西」——這是一個機制,而不只是一次猜對。

機制可解釋性追求的是正確輸出背後的演算法,而不只是輸出本身。

要把它和那種只把輸入與輸出做關聯的廣義可解釋性(例如顯著性熱圖)區分開來:機制研究要求對內部步驟給出因果說明,而且就算如此,一個看似合理的說法也只是證據,而不是證明。

又称
interpmech interp機制可解釋性可解釋性