可解釋性

探測 LLM 表徵(probing LLM representations)

探測問的是一個直接的問題:某項資訊是否存在於模型的內部向量裡?你把模型凍結,蒐集它在許多輸入上的隱藏激活值,再訓練一個小型、獨立的分類器——探針(probe)——從這些激活值去預測你關心的某個屬性,例如詞性、情感、一句陳述的真假,甚至一段棋譜所隱含的盤面狀態。如果探針成功,那項資訊就是能從表徵中線性讀出的。

它受歡迎,是因為既簡單又能揭露東西。一個簡單的線性探針若能良好還原某屬性,就暗示模型以一種可取用、大致線性的形式編碼了那個屬性;探針若失敗,則暗示該資訊不存在、糾纏在一起、或以非線性方式儲存。跨層做探測會顯示不同種類的資訊在堆疊的哪裡變得可用,描繪出表徵的發展圖像。

但探測量的是「可取得性」,不是「有沒有被用到」。一個屬性可被解碼,不代表模型靠它來產生輸出——若你讓探針太強大,它甚至可能自己學會那個屬性。這就是為什麼探測最好搭配像替換激活值這類因果工具,後者會檢查被編碼的資訊在下游是否真的在做事。

又稱
probing classifiersdiagnostic classifiers