Transformer 引擎

注意力頭的角色(attention head roles)

當研究者窺探一個訓練好的 Transformer 內部,會發現個別的頭悄悄分了工。有些成了「前一個詞元頭」,大多往回看一步;有些是語法頭,把動詞接到它的主詞;有些追蹤引號或成對的括號。沒有人指派這些工作——它們是從訓練中浮現的,就像生產線上的工人,逐漸漂向自己剛好最拿手的任務。

一個著名的例子是「歸納頭(induction head)」,由一對頭共同實作一條簡單的複製規則:先前看過「A B」這個模式後,它們幫模型在下一個 A 之後再次預測 B。這類電路,正是大型語言模型能從提示裡的少數範例學會某種格式的重要原因。其他的頭則負責位置記帳、去重,或把罕見事實導向適當之處。

這些角色是真的,但很雜。許多頭是多義的,做著好幾件鬆散相關的事;有些幾乎是多餘的,剪掉也損失不大。所以「這個頭負責 X」是個有用的近似,而不是一張乾淨的接線圖——可解釋性的研究,仍在繪製到底哪些頭重要、又為什麼重要。