Transformer 引擎
殘差流(residual stream)
想像一條輸送帶筆直地穿過整個模型往上跑。每個詞元一開始以它的嵌入向量上帶,而每一層不是把帶上的東西換掉,而是單純把自己的貢獻加在上面。這個累加的總和就是殘差流——資訊從輸入一路傳到最終預測所沿著的中央幹道。
具體來說,每個子層算出一個更新再把它加回去:輸出等於輸入,加上注意力或前饋區塊產生的東西。這些殘差連接,意味著訓練時梯度能順著帶子一路往下流而不消失,這正是讓非常深的堆疊得以訓練的關鍵。由於一切都加進同一個共用空間,各層既能讀到較早的層寫了什麼,也能寫下訊息給較晚的層去取用。
這種相加的觀點是現代可解釋性的骨幹。殘差流像是一條頻寬有限的共用通訊通道;各個頭與前饋區塊以特定方向從中讀取、向中寫入。把運算想成是加到這條流上的一則則訊息,而不是不透明的層輸出,正是讓研究者能追蹤某個特定事實或行為是怎麼被組裝出來的原因。
又称
另见