可解釋性
歸納頭(induction heads)
歸納頭是 LLM 中第一個被乾淨逆向工程出來的零件,而它做的事簡單得令人愉快:靠複製來延續樣式。如果序列稍早出現過「Harry Potter」這個雙詞組,現在模型又看到「Harry」,歸納頭就會回看稍早那個「Harry」、注意到它後面接什麼、然後預測「Potter」。它實現的規則是:我以前看過這個;接在後面的是這個。
機制上它是一個兩頭電路。較早的「前一詞元頭」會在每個位置寫上「它前面那個詞元」的資訊。較晚的歸納頭接著形成一個查詢,去搜尋某個較早位置——其儲存的前一詞元剛好等於目前的詞元——注意到那裡,再把後面那個詞元往前複製。這兩個頭透過殘差流組合起來,成為一套能運作的「複製樣式」演算法,是單一個頭辦不到的。
歸納頭的意義不只在於它自己這個小把戲。它們在訓練中一個陡峭的相變點浮現,而那個時點正好對上模型「從語境學習」能力的一次跳升,許多研究者把它們看作脈絡內學習本身的一種基本成分。它們是「transformer 內部真的能找到可命名演算法」的標誌性證明。
又稱
另見