人工智慧安全與對齊

稀疏自編碼器特徵(sparse autoencoder features)

稀疏自編碼器特徵是一種可解釋性工具,它把神經網路的激活拆解成一大組「大多關閉、各自有意義」的方向。背後的問題是疊加(superposition):一層僅幾千個神經元的網路,似乎靠著讓特徵共用神經元,塞進了數以萬計的概念,於是單一神經元是多義的,會為彼此無關的概念一起亮起。寄望在於真正的特徵是稀疏的——同時只有少數啟動——並且能被還原。

其方法是在模型的激活向量上,以重度稀疏懲罰訓練一個很寬的自編碼器,學出一部過完備(overcomplete)的方向字典,使每個輸入都被重建為字典原子的稀疏非負組合。每個字典原子都是一個候選特徵;訓練好的編碼器會回報某輸入上哪些特徵被觸發,而檢視時常發現驚人地單義的單元——一個對應某特定人物、一個對應某句法模式、一個對應某危害概念——遠比原始神經元乾淨。

這些特徵之所以重要,是因為它們給了一套讀取與編輯內部狀態的詞彙:你可以找到一個「欺騙」或「諂媚」特徵,觀察它何時啟動,並把它鉗制住以引導行為。但提醒也是真實的:特徵分裂意味著同一概念會隨字典變大而碎散到多個原子;重建是有損的;而且一個特徵對人類可解釋,並不證明它就是模型在因果上所使用的,所以需要因果檢驗。

\mathbf{a}\approx \hat{\mathbf{a}}=\sum_i f_i(\mathbf{a})\,\mathbf{d}_i,\quad \mathcal{L}=\lVert \mathbf{a}-\hat{\mathbf{a}}\rVert_2^2+\lambda\lVert \mathbf{f}(\mathbf{a})\rVert_1

把激活重建為字典方向的稀疏非負組合;L1 項迫使只有少數特徵被觸發。

又稱
SAE features稀疏自編碼器特徵dictionary features