可解釋性

歸納頭(induction head)

如果我說「Mrs. Dalloway said she would buy the flowers herself… Mrs. Dalloway said she would buy the」,你會立刻預期「flowers」。你並不是在針對花做推理;你是注意到一個模式正在重複,並複製它的後續。歸納頭就是 Transformer 內部一個學會了這個小把戲的元件:察覺到近期的上下文正在重複先前的一段話,並預測上次接在後面的東西。

從機制上看,它是電路一個既漂亮又具體的例子。它通常以一對注意力頭運作。當前的詞元,比方說某個名字的前半部,會觸發一場往回搜尋,去找這個相同詞元上一次出現的地方;接著第二個頭去注意當時接在它後面的詞元,並把那個詞元向前複製,作為預測。簡言之:「先前 A 後面接的是 B;我剛又看到 A,所以我預測 B。」這種「上下文內複製」是模型如何在不改動任何權重的情況下,光從提示本身就拾取模式的基礎。

歸納頭對可解釋性很重要,因為它是研究者最早完整逆向工程並以因果方式驗證過的非平凡運算之一,使它成為「Transformer 內部真實電路是可以被理解的」這件事的概念驗證。它也和上下文學習(in-context learning)有關——也就是模型那項驚人的能力:能從提示中的範例學會一個新模式。提醒在於:教科書式的「兩個頭」故事是一種乾淨的理想化;在大型模型中,這個行為散布在許多頭上,並與其他機制混雜,因此「歸納頭」是一個有用的抽象,而不是單一一個整齊的小裝置。

給模型一個它從未見過的自創模式:「glorp 7, blint 4, glorp ___」。它傾向回答「7」。它不可能知道 glorp 是什麼意思;歸納頭只是找到先前那個「glorp」,並複製接在它後面的東西。

歸納頭複製一個模式的後續:先前看過 A 接著 B;現在又見 A;於是預測 B。

乾淨的「兩個頭」電路是一種理想化。在大型模型中,歸納是分散的,並與其他元件糾纏在一起,因此那張整齊的圖是一種抽象,而非字面上的接線圖。

又稱
induction head歸納頭歸納注意力頭