現代大型語言模型架構內部
滑動視窗注意力(sliding-window attention)
完整注意力讓每個詞元都能看向所有更早的詞元,而這種兩兩比較的成本隨序列長度的平方成長,到了數千個詞元就變得殘酷。滑動視窗注意力為視野設了上限:每個詞元只能關注固定數量的鄰近前驅,例如最近的數千個,就像用一支手電筒閱讀,只照亮近處那一頁而非整本書。
這讓成本隨長度線性成長,並把 KV 快取限制在固定大小,因為舊詞元會滑出視窗。長距離資訊並非全然遺失:堆疊許多帶視窗的層,能讓影響力隨每一層傳得更遠,就像謠言一個鄰居傳一個鄰居,於是一個詞元能間接觸及遠在自己視窗之外的上下文。許多模型把帶視窗的層與偶爾的完整注意力層交錯,以在多數層維持低成本的同時找回真正的長距離連結。
又稱
另見