現代大型語言模型架構內部

線性注意力(linear attention)

標準注意力會建出一張完整的表,把每個查詢和每個鍵相比,而這張表正是讓成本隨序列長度平方成長的元兇。線性注意力根本不建這張表。它用一種更簡單、可拆解的相似度取代 softmax,便能重排運算順序,讓每個新詞元只去更新一份固定大小、彙整所有過去鍵與值的運行摘要,很像狀態空間模型在做筆記。

關鍵在於結合律:透過核特徵映射,你可以先把鍵乘上值並累加進單一矩陣,再用每個查詢去套用那個累加器,把平方成本變成線性。結果是讀取與生成的時間與長度成正比,且記憶體有界。誠實的取捨是準確度:拿掉銳利的 softmax 通常會鈍化模型精準聚焦於單一詞元的能力,所以在重回憶的任務上,線性注意力往往落後完整注意力,除非經過細心設計或混合。

又称
linear-time attentionkernelized attention