現代大型語言模型架構內部

長上下文架構(long-context architectures)

模型的上下文視窗是指它一次能讀進多少詞元,而要把它從數千推到數十萬,會撞上兩道牆:隨長度平方成長的注意力成本,以及從未在這種距離上訓練過的位置編碼。長上下文架構就是一袋繞過這兩者的技巧,好讓模型能一次吞下整本書或整個程式碼庫。

在位置這一邊,最常見的招數是縮放 RoPE 的頻率,讓同樣的旋轉覆蓋遠更寬的範圍,有時再用少量長樣本短暫微調。在成本這一邊,設計者會動用滑動視窗或其他稀疏注意力、分組查詢注意力與 KV 快取壓縮來塞進記憶體,以及分頁注意力、環形注意力之類的服務技巧。一個誠實的提醒是:大視窗並不保證能好好利用它;模型往往在頭尾附近檢索得不錯,卻在中段遺失細節。

長的上下文視窗不等於良好的長上下文推理;著名的「迷失在中段」效應顯示,放在長輸入中段的事實準確度會下滑。

又稱
context window extensionlong-context design