可解釋性

疊加假說(superposition hypothesis)

模型似乎懂得的相異概念,遠多於它用來儲存的神經元數量。疊加假說解釋了這是怎麼辦到的:某一層把許多特徵塞進同一組神經元,做法是把每個特徵表示成激活空間中自己的一個方向,再讓這些方向彼此重疊。想像一個小房間,你讓上千支箭朝各個方向亂指就塞了進去——沒有一支獨佔一個軸,但只要同時亮起的很少,你仍能分辨它們。

這之所以行得通,是因為特徵是稀疏的:在任一語境中只有少數幾個概念在場,所以重疊方向之間的干擾小到可以忍受。網路用一點雜訊換來容量上的巨大收益,儲存的特徵比維度還多。代價是個別神經元變得「多義」——一個神經元會為好幾件不相關的事情放電——這正是為什麼逐一神經元地去讀模型會那麼令人困惑。

疊加是促成稀疏自編碼器的核心障礙。如果每個概念都分到一個乾淨的神經元,可解釋性就會很容易。正因為它們被摺疊在一起,這門領域的大半工作就是把它們攤開:還原網路壓進較小空間裡那些隱藏、近乎正交的特徵方向。

m \text{ features in } n \text{ neurons}, \quad m \gg n

疊加儲存的稀疏特徵數(m)遠多於神經元數(n)。

疊加是假說而非已證明的定律——但它預測了多義神經元,而我們確實觀察到了。

又称
feature superposition