電路(circuit)
知道模型內部使用的詞彙(它的特徵),就像知道工作檯上擺了哪些零件。但要理解一台機器,得看清這些零件如何連接起來完成一項工作。電路正是如此:一小組內部元件——特定的神經元、注意力頭,以及它們讀取與寫入的特徵——被連接在一起,讓它們一步一步地執行一項可辨識的運算。
具體來說,電路是網路針對某個特定任務的局部接線圖。你追蹤前段某個部分如何偵測到某樣東西、把它傳遞下去,而後段某個部分如何根據它採取動作。經典例子是 Transformer 中的歸納電路:一個注意力頭找到目前這個詞上次出現的位置,第二個頭去看上次它後面接了什麼,兩者合作便實作出「再次預測相同的後續」。你可以說出每個元件的職責,並證明移除其中任何一個都會破壞該行為——這正是把「猜測」變成「電路」的關鍵。
電路之所以重要,是因為唯有在這個層次,「它為什麼那樣做?」才能得到真正的答案,而不只是一種感覺。如果你能畫出模型用來判斷是否拒絕有害請求的電路,你就能查核它究竟是在做真正的「危害推理」,還是只是在做關鍵字比對——而後者攻擊者可以輕易繞過。誠實的提醒是:到目前為止被完整畫出的電路,多半涵蓋的是狹窄、近乎玩具的行為;要把電路分析擴展到模型那些重要而雜亂的能力,仍是一個尚未解決的困難問題。
在這個間接受詞任務「When John and Mary went to the store, John gave a drink to ___」中,Transformer 會回答「Mary」。研究者畫出了一個由協作的注意力頭組成的電路——有些頭負責找出名字,有一個頭負責抑制重複出現的名字「John」——它們共同產生了正確答案。
電路是某一行為的接線圖:特徵,加上負責傳遞它們的元件。
用手工找出的電路,在經過因果檢驗(例如逐一消融每個部分)之前都只是假說;一張只是看起來合理的圖,仍可能是一種解釋幻覺。