Transformer 與大型語言模型內部機制

歸納頭(induction heads)

歸納頭是一種特定的注意力電路,由機制可解釋性研究發現,能讓 transformer 接續它剛看過的模式。若上下文某處出現 A B,後面又出現 A,歸納頭會注意到較早的 A、看它後面跟著什麼(B),然後提高下一個 token 是 B 的機率。白話說,它實作了這條規則:這之前出現過;後面接什麼?再預測那個。

該電路由兩個跨層協同運作的頭組成。較早一層的「前一 token 頭」把「前一個 token 是什麼」的資訊寫入每個位置的殘差流。較後的歸納頭再以當前 token 形成查詢,去比對那些前一 token 的簽章,於是注意到當前 token 較早出現之處的後一個位置,並把該 token 複製到前面來。這種前綴比對與複製,是透過殘差流的查詢/鍵組合(composition)達成的。

歸納頭之所以重要,是因為它們在訓練中以一個陡峭的相變浮現,恰好與情境學習能力的突跳同步——這是它們為情境學習主要機制的有力證據。它們是電路(circuits)研究綱領的旗艦成果,顯示可解釋的演算法能從學得的權重逆向工程出來。

又称
induction heads歸納頭