從相關到因果
到目前為止的一切——探測、注意力圖、logit lens——都是「相關性」的:它們顯示什麼存在,而不是模型用了什麼。要做出因果主張,你必須介入。最簡單的介入是 消融(ablation):把某個元件歸零或拔掉,看行為會不會壞掉。如果移除某個 head 摧毀了模型補上右括號的能力,那這個 head 對「補右括號」這件事大概是重要的。消融很鈍,但它是通往下面那些更銳利工具的入口。
激活修補:主力工具
激活修補(activation patching)——又稱因果追蹤(causal tracing)——是這個領域的招牌技術。讓模型分別跑一個「乾淨」提示和一個只在單一事實上不同的「污染」提示,並把兩者的激活值都快取下來。接著再跑一次污染提示,但把某一個元件的「乾淨」激活值「修補」進去。如果這單一替換把答案翻回乾淨版本,那這個元件就攜帶了關鍵的資訊。把這個修補掃過每一層、每個位置,你就得到一張熱圖,精確顯示模型把那個決定性事實存在哪裡、又搬到哪裡。
- 造一組乾淨/污染配對,只在你研究的東西上不同(例如「巴黎」對「羅馬」)。
- 把乾淨那次的所有激活值快取下來。
- 重跑污染提示,把某一個元件的激活值換成快取的乾淨值。
- 量測輸出朝乾淨答案移動了多少;在各元件上重複,以完成定位。
Transformer 块示意图,显示归一化、注意力、残差连接和前馈网络。
發現電路與定位知識
把許多次修補串接起來,你就能描繪出對某個行為負責的整個子圖——這就是 電路發現(circuit discovery)。目標是一張接線圖:這些 head 偵測主詞、那些 head 把它搬到最後位置、那個前饋區塊查出屬性、解嵌入再把它讀出來。做得好的話,一個電路就是一個可證偽的主張——你能預測編輯每個節點會發生什麼。
交互式自注意力:点击一个词元会高亮它所关注的其他词元。
一個聚焦的應用是 概念與知識定位(concept and knowledge localization):找出某個具體事實——「艾菲爾鐵塔在巴黎」——住在「哪裡」。因果追蹤反覆指向中層的前饋區塊作為事實儲存處,這又使得有針對性的「模型編輯」成為可能:改掉那個被儲存的關聯,模型就會一致地回答「羅馬」,連改寫過的問法也是。定位加上編輯,是「一個機制故事可以同時為真又有用」最清楚的示範之一。
操控、安全與誠實的讀取
因果定位又回頭餵進控制。激活操控(activation steering)會加上一個方向——例如,從對比「誠實」與「欺騙」提示上的激活值所萃取出來的方向——在推論時推一把行為。安全上的夢想更大:引出潛在知識(eliciting latent knowledge),讀出模型「內部相信什麼」,即使它嘴上說的相反,這樣我們就能逮到一個明知自己在欺騙的模型。這些是研究方向,不是已解決的問題,但正因如此,可解釋性被當成核心的安全基礎設施,而不是一項好奇心。
激活操控向隐藏状态添加一个带缩放系数的方向向量 v,其中 v 是诚实与欺骗激活之差。