可解釋性
機制可解釋性(mechanistic interpretability)
機制可解釋性把神經網路當成一塊沒人留下文件、又很怪的硬體,試圖把它逆向工程。它問的不只是哪些輸入會改變輸出,而是要還原出演算法:到底是哪些具體的權重與激活值在實現某個行為,它們又如何接線、組成一步步的運算。其志向是還原出原則上你能親手重新實作的東西。
分析的單位是電路(circuit)——由特徵,以及把它們連起來的注意力頭或神經元所組成的小子圖,合力完成一項任務,例如偵測某個詞元先前出現過、再把它往前複製。研究者透過替換激活值、消融元件、解碼內部方向來找出這些電路,再驗證所提的機制確實驅動了輸出。成功的樣貌是一個忠實又能預測的說法:改動電路,行為就會如說法所言地改變。
這是可解釋性中最有野心、也最脆弱的分支。真實電路雜亂、特徵在疊加中相互重疊,乾淨的玩具結果很少能原封不動地擴展到上千億參數的模型。儘管如此,它確實帶來了真正令人意外的發現——歸納頭、複製抑制、跨模型反覆出現的母題——這些較不像在編故事,更像在找到模型真正的齒輪。
又称
另见