可解釋性
疊加假說(the superposition hypothesis)
假設你有十個電燈開關,卻有一千件想要傳達的事。你可以約定一套編碼,讓每個訊息對應一組特定的開關組合,只要你很少同時送出兩個訊息,就能塞進遠多於開關數量的意義。疊加假說說的是:神經網路做的事有點像這樣——它表示的特徵數量遠多於它擁有的神經元數量,方法是把特徵儲存成彼此重疊的方向組合,而不是「一個神經元對應一個特徵」。
其中的道理是幾何性的。一個有 n 個神經元的層,只有 n 個互相垂直的方向,因此最多只能乾淨地分開儲存 n 個特徵。但世界上有用的概念遠多於此。網路似乎利用了一個事實:在高維空間裡,你可以塞進許多「幾乎垂直」的方向,而且大多數特徵很稀有(多數時候是熄滅的)。藉由容忍一點點干擾,模型把成千上萬個特徵擠進一個「本來」只能裝幾百個的空間——用少量雜訊換取容量上的巨大增益。
正如其名,疊加是一個假說——它在玩具模型中得到良好支持,在真實模型中也愈來愈有證據,但仍是一個有效的理論,而非已被證明的定律。它對可解釋性、進而對安全極為重要:如果特徵被擠在一起、抹散在許多神經元上,那麼盯著單一神經元看幾乎得不到什麼,而我們想稽核的乾淨概念就藏在這些重疊之中。正是這個診斷,催生了稀疏自編碼器這類工具,試圖把疊加拆解開來。
在研究者訓練的一個極小模型中,當它被迫壓縮比神經元數量更多的特徵時,模型自發地把它們儲存成彼此重疊的方向,甚至把它們排成整齊的幾何形狀——這是疊加現象在微型尺度上的乾淨示範。
疊加:特徵比神經元多,以彼此重疊的方向儲存,代價是一點點干擾。
疊加解釋了為什麼單一神經元通常具有多義性;它是目前最主流的假說,而非定論,而前沿模型中疊加的程度仍在測量之中。
又称
另见