Transformer 引擎

Transformer 區塊堆疊(transformer block stack)

Transformer 的力量來自重複。單一個區塊——注意力接著一個前饋網路,各自包在正規化與一次殘差相加裡——很有用,但有限。把幾十個結構相同的區塊疊起來,更豐富的東西就浮現了:較早的層處理像詞形與局部文法這類表層模式,中間的層組裝詞組與意義,較晚的層則塑造驅動最終預測的抽象特徵。

每個區塊都從殘差流讀取、算出自己的更新、再加回去,於是同一個向量槽位隨著它在堆疊裡上升,被一次又一次地精修。這些區塊結構相同卻學到不同的權重,形成一種處理流水線。深度(有幾個區塊)與寬度(每個向量多大),連同注意力頭的數量,是設定一個模型大小的幾個主要旋鈕。

這種一致、可重複的設計,是 Transformer 能如此順暢擴展的部分原因:增加容量大多只是再疊更多同樣的區塊。它也意味著沒有單一個「理解發生」的層——意義是逐步建起來的,而可解釋性研究常常去追蹤一個特徵是怎麼一層一層變得清晰的。

又稱
layersdepth