可解釋性

概念與知識定位(concept and knowledge localization)

當一個模型知道艾菲爾鐵塔在巴黎,這項事實到底住在哪裡?知識定位試圖釘出是哪些權重、哪些層儲存了某項特定資訊,而不是把知識當成均勻塗抹在整個網路上。它的盼望是:事實夠模組化,足以被找到——一旦找到,就能在不重訓整個模型的情況下檢視、編輯或修正它。

主要工具是因果追蹤:破壞主詞詞元,再逐層把乾淨激活值替換回去,看哪些還原讓事實復活。這類分析暗示,許多事實性關聯集中在中間層的前饋區塊裡,那些區塊的行為像一套鍵—值記憶體。像 ROME 與 MEMIT 這些方法即以此為基礎,透過直接改寫相關權重來編輯一項事實。

實情比早期結果所暗示的更糾結。定位出「編輯在哪裡會成功」,並不等於找到「事實儲存在哪裡」——事實往往是分散且冗餘的、編輯可能對相關知識產生副作用,而模型也可能透過好幾條路徑取回同一項事實。定位是真實的訊號,但是片面且有爭議的。

又稱
knowledge localizationfact localization