可解釋性

稀疏自編碼器(sparse autoencoders,用於 LLM)

稀疏自編碼器是用來「拆解疊加」的工具。它是一個外掛在凍結 LLM 某一層上的小網路:拿到那一層糾纏的激活向量後,把它展開成一個寬得多的特徵清單,強迫其中幾乎全部同時為零,再從剩下的少數幾個重建出原始向量。因為同時只准少數幾個亮起,每一個都被逼著去代表單一、乾淨的概念。

機制上它學的是一本「過完備字典」。編碼器把一個激活值映射成數千甚至數百萬個稀疏的特徵係數;解碼器再把激活值重建為這些學到的特徵方向之稀疏加總。訓練時最小化重建誤差再加上一個稀疏懲罰項。一旦奏效,檢視每個特徵被哪些頂端例子點亮,會揭露出意外好懂的單元——一個代表法律語言的特徵、一個代表金門大橋的特徵、一個代表開檔程式碼的特徵。

稀疏自編碼器已成為現代機制可解釋性的主力,因為它把一個不透明的向量,變成一份可讀的「在場概念」清單。但它並不完美:特徵會隨字典大小而被拆開或合併、重建是有損的,而一個看起來乾淨的特徵,在你相信模型真的用到它之前,仍需要因果驗證。

\min_{E,D} \; \| x - D\,f \|_2^2 + \lambda \|f\|_1, \quad f = \mathrm{ReLU}(E x)

用稀疏編碼 f 重建激活值 x(L1 懲罰 λ 鼓勵稀疏)。

又称
SAEsdictionary learning