可解釋性

多義神經元(polysemantic neuron)

/ pol-ee-suh-MAN-tik /

如果模型裡每個神經元都恰好代表一件乾淨的事——這個對貓放電、那個對紅色放電——那該有多好。早期的可解釋性正是這樣期望的。然而當你真的去檢視一個神經元時,常會發現它對一個令人困惑的雜燴同時放電:貓臉、法律文件的開頭,還有日文,全混在一起。一個像這樣對好幾個互不相關的概念都有反應的神經元,就被稱為多義的——「身兼多義」。

為什麼網路會打造出這麼令人困惑的零件?最主流的解釋是疊加。因為模型想追蹤的特徵比它擁有的神經元更多,它負擔不起為每個概念專門撥出一整個神經元。於是單一神經元最終參與了許多不同的特徵方向,只要它分擔職責的任何一個概念出現,它就放電。與之相反、罕見的理想狀態——一個神經元對應一個概念——稱為單義神經元,而真實模型中的大多數神經元遠遠達不到這種乾淨。

多義性是讀懂模型的核心障礙之一。如果每個神經元都代表好幾件事,你就無法靠逐一替神經元貼標籤來理解網路,而你為了安全所在意的某個特徵,可能根本不存在於任何單一神經元中。這正是字典學習與稀疏自編碼器所要攻克的問題:它們不去詮釋神經元,而是試圖從多義的混亂中還原出底層的單義特徵。

檢視視覺模型中的某一個神經元,你可能會看到它對貓臉、車頭以及貓腿都放電。它不是「貓神經元」;它是被好幾個特徵編碼共用的一個開關——一個教科書等級的多義神經元。

多義:一個神經元,好幾種互不相關的意義——通常是疊加現象的徵兆。

不要把一個神經元的標籤當成模型真正的概念。你想要的那個單義特徵,通常是橫跨許多神經元的一個方向,而不是那個神經元本身。

又稱
polysemanticity多義性多義神經元