可解釋性

神經元解讀(neuron interpretation)

最基本的可解釋性動作,就是挑一個神經元、問什麼會讓它放電。你掃過一大批語料,蒐集把某個神經元激活值推到最高的那些輸入,找出一個樣式:也許它在法文上飆高、在「not」這個字上、在引號內部、或在一個數字之後。一個有清晰、一致觸發條件的神經元是「單義」的,能給出一個整齊的小標籤。

在大規模上這已被自動化:用一個模型替另一個模型的每個神經元寫下「它在偵測什麼」的自然語言猜測,再用「能否預測該神經元在保留文本上的激活值」來替那個解釋打分。這是替數百萬個神經元貼上初步說明的辦法。這個練習也揭露了結構——負責語法的、負責特定詞元的、負責抽象特徵的神經元——分散在各層之間。

殘酷的事實是:多數神經元是多義的——單一個神經元會為好幾個不相關的概念放電,因為疊加把許多特徵塞進少數神經元裡。所以神經元標籤往往只是片面的,而這個領域已大致轉向稀疏自編碼器特徵,後者把激活值切成比原始神經元更乾淨、更單義的單元。

又称
neuron labelingsingle-neuron analysis