現代大型語言模型架構內部
混合注意力與狀態空間模型(hybrid attention–SSM models)
注意力精準但昂貴;狀態空間與線性注意力層便宜,但對精確回憶含糊。混合模型乾脆兩者都用,把多數高效的遞迴層或帶視窗層,與零星幾個完整注意力層交錯排列。把便宜的層想成穩定的主力,以固定成本把資訊往前帶;而那少數幾個注意力層則是偶爾的精準查找,在關鍵時刻釘住某個確切的早期詞元。
設計上的問題是比例與位置:每個注意力層配幾個遞迴層,以及注意力層擺在哪裡。一個常見配方大約是每數個狀態空間層配一個注意力層,這保住了大部分的速度與有界記憶體,同時找回純狀態空間模型所缺的銳利複製與檢索能力。這種混合是目前最有希望的路線,能造出既在超長上下文上高效、品質又能與純 transformer 一較高下的模型。
又称
另见