可解釋性

特徵(feature)

當你閱讀時,你的大腦似乎在追蹤一些概念——「這段文字在講巴黎」、「這聽起來很諷刺」、「有個引號開了還沒關」。特徵就是網路版本的這類概念:一種特定的內部活動模式,當輸入中出現某個對人類有意義的概念時就可靠地被點亮,否則就保持熄滅。它是可解釋性試圖讀取的最基本的意義單位。

技術上來說,模型在每一層把它正在「想」的東西表示成一長串數字(一個向量)。特徵通常被建模成這個空間裡的一個方向:把活動向量和這個方向做內積,會得到一個數值,當概念出現時這個數值就很大。研究者找到過對應出奇乾淨概念的特徵——金門大橋、含有資安漏洞的程式碼、某種語言的文字、奉承的語氣——而且關鍵在於,沿著那個方向去推動活動,能相應地改變模型的行為,這正是讓一個候選方向被視為真實特徵、而非巧合的依據。

特徵之所以重要,是因為它們是任何誠實的內部稽核所需要的詞彙:要問「模型現在是不是在想欺騙?」,你首先需要一個可信的「欺騙」特徵。麻煩在於,特徵不會貼好標籤交到我們手上。單一神經元通常雜亂且身兼多義(多義性),因此乾淨的特徵往往是散布在許多神經元上的組合——這正是稀疏自編碼器這類工具被打造出來、試圖把它們拆解開來的原因。

研究者在一個大型模型內部分離出一個「金門大橋」特徵。當他們人為放大它時,模型開始幾乎把每一段對話都導向那座橋——甚至把自己描述成那座橋——這有力地證明了那個方向確實編碼了該概念。

特徵是激活空間中追蹤某個概念的一個方向;改變它就會改變行為。

神經元和特徵不是同一回事。由於疊加現象,一個特徵往往橫跨許多神經元,而一個神經元也往往承載許多特徵。

又称
feature概念方向可解釋特徵