可解釋性
解釋的忠實度(faithfulness of explanations)
一個解釋可以很有說服力,卻仍然是假的。忠實度問的是:一個解釋是否真的反映了模型所進行的運算,而不是僅僅對人類聽起來合理。對語言模型來說這個分別格外尖銳,因為它們能敘述自己的推理——一段思路鏈——讀起來漂亮,卻可能跟答案實際如何產生毫無關係。「看似合理」不等於「為真」。
這個危險在可解釋性裡無所不在。一張乾淨的注意力圖、一個整齊的神經元標籤、一段自信的自我解釋、或一張漂亮的電路圖,全都可能是事後合理化。已有研究顯示模型給出的推理,會忽略真正左右它的線索,並產生「為了滿足讀者、而非揭露機制」而最佳化過的解釋。不忠實的解釋比沒有解釋更糟,因為它孕育出虛假的信心。
這正是為什麼這個領域堅持因果測試。要贏得忠實度,靠的是介入:消融、替換或操控一個解釋所指名的元件,再檢查行為是否正好如預測般移動。忠實度是把「作為證據的可解釋性」與「作為說故事的可解釋性」分開的品管標準,也是這裡每一種方法最終都得跨過的門檻。
模型的思路鏈是一段看似合理的敘述,不是它運算過程的保證忠實紀錄。
又称
另见