穩健性與可解釋性

機制可解釋性(mechanistic interpretability)

/ mek-uh-NIS-tik in-TER-prit-uh-BIL-uh-tee /

機制可解釋性,是試圖像逆向一塊電路板那樣去逆向一個神經網路——逐個神經元、逐條連接地追蹤那真正發生的計算,以找出模型學到的那個演算法。別的可解釋性方法問的是「哪些輸入要緊?」,而這一種問的是更深的問題:「這個網路在裡頭到底在做什麼,我們能不能把它寫成一套可理解的機制?」

其夢想,是發現一團纏繞的權重,暗地裡其實在實現某種叫得出名字的東西。比如,研究者已在視覺模型裡找到專門偵測曲線的特定神經元,也在語言模型裡找到一小簇組件,它們合在一起執行一個可辨認的子程序——把前文提到過的一個名字複製過來,或是追蹤哪一個括號該閉合了。他們把這樣一個被發現的、可複用的機制稱為「迴路」(circuit)。人們期望:複雜行為是由許許多多這樣的迴路搭起來的,而我們能把它們一一繪成圖。

隨著模型愈發能幹、並被我們部署到高風險的崗位上,這件事愈發要緊。倘若我們真能理解一個模型的內部機制,就能核驗它沒有藏著一套欺騙性的策略、或一種危險的能力——這正是AI安全的一個核心目標。但誠實要求我們正視規模:機制可解釋性已在小模型和孤立行為上做出了漂亮而嚴謹的成果,可要完整逆向一個擁有數十億參數的前沿模型,仍遠遠超出當下的能力。它是這個領域裡最有希望、也最是貨真價實地艱難的前沿之一,而非一項你想跑就能跑的、已經解決了的診斷工具。

在小型Transformer裡,研究者識別出了一種「歸納頭」(induction head)——一對注意力組件,合在一起實現一條簡單的規則:當你看到一個詞元,就往回找它上一次出現的地方,再預測「當時它後面跟的是什麼」。這是一個在權重內部找到的、真實而有名有姓的演算法,它支撐起了模型「續接模式」這一能力的很大一部分。

一個「歸納頭」:在Transformer權重內部發現的、一個貨真價實的、習得的演算法。

別把機制可解釋性,與那些輕量工具(SHAP、顯著性、注意力圖)混為一談。後者是從外部描述輸入與輸出之間的行為;機制可解釋性則試圖把內部的演算法本身讀出來。它的雄心遠大得多——也遠不如前者完整。那種「我們已能徹底『打開』如今最大的模型、並為其安全性背書」的說法,仍只是一種願景。

又稱
mech interpreverse-engineering neural networks机制可解释性機制可解釋性