Transformer 引擎

Transformer 架構(Transformer)

Transformer 是幾乎所有現代大型語言模型背後的藍圖。想像一條工廠生產線,句子裡的每個詞不是一個接一個處理,而是同時被處理;在每個工作站,每個詞都能看一眼其他所有詞,並把自己需要的脈絡拉進來。讓詞彼此直接互看這個簡單的把戲,正是 Transformer 特別擅長處理語言的原因。

具體來說,Transformer 是一疊結構相同的區塊。每個區塊有兩個主要部分:注意力層,讓詞元根據相關性交換資訊;以及一個小型前饋網路,單獨處理每個詞元。資訊沿著一條叫做殘差流的累加通道往上層流動,並由正規化把數值維持在合理範圍。把這個區塊重複幾十甚至幾百次,模型就能逐層堆疊出豐富的語意。

Transformer 出自 2017 年的論文〈Attention Is All You Need〉,它取代了循環網路,因為能在現代硬體上平行訓練,也能乾淨地處理長距離的依賴關係。但它並不神奇:它有固定的脈絡視窗,而且成本會隨序列長度快速增長。這個領域裡幾乎其他所有東西,都是建立在這一個架構之上。

又称
transformer architecture