可解釋性

稀疏自編碼器(sparse autoencoder)

想像一桶混濁的調和顏料,你想知道是哪些純色顏料攪在一起調出了它。你沒辦法把顏料逆向分開,但你可以訓練一個助手:給它看那個混濁的顏色,它就說出一小串純色顏料以及各自的用量,並且藉由重新調出一模一樣的顏色來證明它的配方是對的。稀疏自編碼器(SAE)對模型糾纏的內部激活做的就是這件事:它學會把每一個激活改寫成一小組更乾淨、更可詮釋的特徵的組合。

從機制上看,SAE 是一個有兩半的小型神經網路。編碼器把模型的激活向量展開成一個大得多的特徵數值清單,但帶有一條稀疏規則:每次只允許其中少數幾個是非零的。接著解碼器必須僅憑那幾個活躍的特徵,重建出原本的激活。為了成功,SAE 被推動去發現一本方向的字典,其中每個方向對應一個對人類有意義、且通常處於熄滅狀態的概念——正是被疊加抹散在一起的那些單義特徵。當它奏效時,你會得到可讀的特徵,例如「這在講法律體系」或「這段程式碼有漏洞」。

SAE 已成為最令人振奮的可解釋性工具之一,因為它提供了一條從多義神經元通往乾淨特徵、而且能大規模進行的途徑,人們已從前沿模型中萃取出包含數百萬個特徵的大型字典。但誠實至關重要:SAE 找到的特徵取決於它的設定,有些是重複或碎片,而不是模型真正的原子;SAE 永遠無法完美重建激活(因此會漏掉一些訊號);而一個被貼上標籤的特徵只是一個有待檢驗的假說,並非已被證明的模型零件。它們是強大的透鏡,而不是完工的理論。

讓模型處理一句話,把那一層的激活餵進訓練好的 SAE,你得到的不再是一個混濁的向量,而是一段簡短的讀數:對應「舊金山」「一座橋」「觀光」的特徵被點亮了。解碼器僅用這些特徵就能相當接近地重建原本的激活——這正是這些特徵確實存在於其中的證據。

稀疏自編碼器把一個糾纏的激活,改寫成少數幾個乾淨、可命名的特徵。

SAE 是工具,而不是真相本身:不同的訓練會找到不同的字典,重建並不完美,而一個看起來有趣的特徵可能只是人工產物。務必用因果測試加以驗證。

又称
SAE稀疏自編碼器