Transformer 引擎

注意力的直覺(attention intuition)

當你讀到「獎盃放不進手提箱,因為它太大了」,你立刻知道「它」指的是獎盃,而不是手提箱——你把注意力放對了前面那個詞。注意力就是讓大型語言模型擁有同樣能力的機制。對於正在處理的每個詞,模型會決定要多用心去聽其他每個詞,再依此把它們混合起來。

巧妙之處在於,這個「要聽多少」是學出來、而且即時算出來的,形成一組總和為一的權重。一個詞提出自己需要什麼的問題,其他每個詞則宣傳自己能提供什麼,兩者的契合程度決定權重。高度相關的詞拿到大份額;不相關的詞幾乎拿不到。結果是每個詞都得到一個全新、帶有脈絡的版本。

這就是為什麼 Transformer 能如此優雅地處理代名詞、長距離的一致性與轉換的主題——它沒有固定的「鄰近詞」視窗。任何詞元都能一步就回頭連到任何更早的詞元。接下來幾則條目,會逐步拆解這些權重究竟是怎麼建出來的。