JOVANA
Explore Library Glossary Getting Started Three Levels Fields How it works Mission
Join the mission
All guides

可解釋性是什麼意思

為什麼我們想看進大型語言模型內部、解釋「行為」與解釋「機制」的差別,以及什麼樣的解釋才值得信任。

黑盒子問題

大型語言模型是一疊矩陣,裡面有數十億個數字。我們透過讓模型看文字、推動這些數字把下一個 token 預測得更好來訓練它們——但沒有人「寫下」最後產生的行為。模型能翻譯詩、除錯程式、拒絕危險的請求,可是如果你問它「為什麼」給出某個特定答案,誠實的預設答案是:我們並不完全知道。這道鴻溝就是 大型語言模型可解釋性(interpretability)所研究的:把一個訓練好的網路,從不透明的人造物,變成我們能讀懂、能預測、能信任的東西。

神经网络是一摞带权重的层——数十亿个训练得到的数字,可解释性正是要还原它们的含义。

多层网络示意图:输入层、隐藏层和输出层由许多带权重的连接相连。

兩種解釋

把這個領域分成兩半會有幫助。「行為式」(或黑盒式)可解釋性從外部研究模型:餵進輸入、觀察輸出、找出規律。它和經典的 可解釋 AI(explainable AI)方法重疊——顯著圖、特徵歸因、請模型自我解釋。「機制式」可解釋性則打開盒子,研究內部運算:哪些元件亮起來、什麼資訊流過它們、又如何產生輸出。它在大型語言模型上的版本就是 機制可解釋性(mechanistic interpretability),也是本系列大部分內容所在之處。

显著性图突出显示哪些输入词元驱动了预测——这是经典的行为式、黑箱解释。

显著性图,突出显示对模型输出影响最大的输入词。

這條分界線很重要,因為兩者回答的是不同問題。行為式方法告訴你模型「依賴」某個詞;機制式方法則試圖告訴你某個具體電路「如何」用它來運算。借用機器學習中更廣義的 機制可解釋性 計畫的宏大目標:把一個網路逆向工程成類似可讀原始碼的東西。

什麼時候解釋是忠實的

一個關於模型的漂亮故事,如果是錯的就一文不值。這個領域的核心品質門檻是 忠實度(faithfulness):這個解釋是否真的描述了模型執行的運算,還是只是聽起來「合理」?這正是對一個老習慣的尖銳警告——把 注意力權重當成解釋。某個 head 強烈關注某個詞,看起來像是這個詞「導致」了輸出的證據,但注意力是相關性;唯一能確認的方法是介入並檢驗。

為什麼值得費這個功夫

三種動機推動這個領域。第一,除錯:如果模型洩漏訓練資料、偏好某個族群、或捏造引用,你會想找出該負責的機制,而不是用提示詞玩打地鼠。第二,安全:可解釋性是 大型語言模型安全 的承重工具——偵測欺騙、稽核隱藏行為、驗證模型是真的對齊,而不只是在評測時「演」得對齊。第三,科學:這些是我們造出最強大的人造物,理解它們「如何」表徵語言與知識,本身就很有趣。

工具箱地圖

本系列其餘部分會從「模型表徵了什麼」一路爬升到「它如何運算」。我們先從表徵開始——殘差流、特徵,以及「疊加」這個令人意外的想法。接著用稀疏自編碼器把糾纏在一起的特徵拆開。然後直接讀注意力,並用 logit lens 把隱藏狀態投影到詞彙表。最後抵達因果方法——修補激活值與發現電路——這正是解釋從「故事」升級為「經得起檢驗的主張」的地方。

  1. 第 2 篇——表徵:殘差流、特徵、疊加、神經元、探測。
  2. 第 3 篇——稀疏自編碼器:把重疊的特徵拆成乾淨的字典,並用它們來操控。
  3. 第 4 篇——注意力:head 的角色、歸納 head,以及 logit lens。
  4. 第 5 篇——因果:激活修補、電路發現、概念定位、操控,以及再談忠實度。