可解釋性

解釋幻覺(interpretation illusion)

人類是擅長尋找模式的動物:我們在雲裡看見人臉,在隨機雜訊中看見故事。當你窺視神經網路內部時,這同一種本能就變得危險。解釋幻覺指的是:你對模型某個部分在做什麼,給出了一個整齊、令人信服、又符合你所看過的證據的解釋——但它並不是真正的機制。那個故事感覺對了,圖看起來乾淨,模型也確實照你說的方式運作,但理由卻是錯的。

這類幻覺很容易出現,因為可解釋性的證據往往是相關性的、而且是精挑細選的。某個神經元放電最強的那些例子可能全是狗,於是你叫它「狗神經元」——但在更廣的資料集上,它其實對毛皮紋理、對「忠誠」這個詞放電得一樣多,你的標籤只是「你剛好檢視了哪些例子」造成的人工產物。一個線性探針可能漂亮地解碼出某個概念,而模型卻從不用那項資訊去決定任何事。一張特徵視覺化圖可能是一幅很有說服力的影像,卻仍然錯誤呈現了真正驅動那個單元的東西。每一種情況下,都是一個看似合理的敘事,跑在了真正原因的前頭。

解釋幻覺對安全極為重要,因為可解釋性的全部價值,就在於我們能信任它告訴我們的東西——而一個自信的錯誤讀數比沒有讀數更糟,因為它製造出毫無根據的信任。這也是為什麼這個領域大力倚賴像激活修補與消融這樣的因果測試,而不是用肉眼判斷:一張特徵視覺化圖或一個探針,是證據,而非證明。實務上的教訓是謙卑——把每一個看起來乾淨的解釋都當作假說,要它在干預測試中存活下來,你才相信它。

研究者發現,一個依其放電最強的例子被標記為偵測某乾淨概念的神經元,在經過因果測試、並用更廣的資料檢驗後,行為其實大不相同——它那整齊的「意義」是由一份過小、過於討喜的例子樣本所製造出來的幻覺。

解釋幻覺:一個符合所選證據、卻不是真正機制的故事。

一張乾淨的視覺化圖或一個高準確率的探針是證據,而非證明。要用因果干預與樣本外測試來防範幻覺,並對自信的讀數保持謙卑。

又称
interpretability illusion解釋幻覺可解釋性幻象