可解釋性

替換激活值(activation patching)

替換激活值是可解釋性版的對照實驗。要測試某個內部元件是否造成某種行為,你讓模型在兩個輸入上各跑一次——一個「乾淨」的、一個會破壞該行為的「損壞」的——然後外科手術式地把乾淨那次的某個激活值複製進損壞那次。如果把這單獨一塊貼回去就讓正確輸出復原,你就定位到了運算中真正要緊的一部分;如果什麼都沒變,那部分只是旁觀者。

它的威力在於測的是因果,而非單純的關聯。探針或注意力圖能告訴你某元件「含有」相關資訊;替換激活值則告訴你該元件「確實被用來」產生結果。把這個替換掃過各層與各位置,你就畫出一張因果地圖,標出相關資訊住在哪、又如何流動。像因果追蹤、路徑替換、歸因替換這些變體,則在大模型上以精度換取速度。

陷阱是真實存在的。結果取決於你如何破壞輸入、元件之間會互相補償(使真正的貢獻者看起來不重要)、替換離分布的激活值也可能造出假象。它之所以是機制工具箱中最受信賴的工具,正因為它「介入」了,但要正確解讀仍需要謹慎的對照。

\Delta = \mathrm{logit}\big(\text{run}_{\text{corrupt}} \;\leftarrow\; a^{\text{clean}}_{\ell,t}\big) - \mathrm{logit}\big(\text{run}_{\text{corrupt}}\big)

把一個乾淨激活值(第 ℓ 層、位置 t)替換進損壞運行所產生的效果。

又称
causal tracinginterchange intervention