現代大型語言模型架構內部

多查詢注意力(multi-query attention,MQA)

多查詢注意力把節省快取的想法推到極限:所有查詢頭共用同一個鍵頭與同一個值頭。標準注意力可能保留 32 份各自獨立的鍵與值,MQA 則各只保留一份。參考卡的比喻變成桌上只有一張卡,每位讀者都查它。結果是最小的 KV 快取與最快的詞元生成,因為每生成一個新詞元要讀取的記憶體大幅減少。

代價是品質略有下降,有時訓練也較不穩定,因為塌縮到單一鍵/值頭抹去了大量表示自由度。正是這個取捨催生了分組查詢注意力這個較溫和的版本,保留少數幾個鍵/值頭而非一個。在記憶體與延遲主導的場合 MQA 仍會出現,但對多數大型模型而言,GQA 因為落在速度與準確度之間更甜的位置而較受青睞。

又稱
MQA