Transformer 與大型語言模型內部機制
狀態空間模型與 Mamba
狀態空間模型(SSM)把序列當作連續的動力系統來處理:它維持一個隨步演化的隱藏狀態,逐步吸收每個輸入並輸出,很像古典的線性遞迴。結構化 SSM,如 S4 及其同類,精心選擇狀態更新矩陣,使整個序列在訓練時可算成快速的平行卷積、在推論時可算成常數記憶體的遞迴——隨長度線性而非二次方。
樸素 SSM 是線性非時變的,意思是其動力學不依賴輸入內容,這限制了它選擇性記住或忽略 token 的能力。Mamba 的貢獻是選擇性:它讓 SSM 的參數,也就是步長與輸入/輸出投影,成為當前輸入的函數,於是模型能逐 token 決定要把什麼留在狀態、把什麼遺忘。這種輸入相依性破壞了卷積捷徑,因此 Mamba 引入一個硬體感知的平行掃描,在 GPU 上高效計算遞迴,而不必把完整狀態序列實體化到慢速記憶體。
結果是一個次二次方的序列模型,品質可與注意力一較高下,並具備真正的常數記憶體遞迴推論模式,對極長上下文很有吸引力。把 Mamba 層與少數注意力層交錯的混合模型,如 Jamba,往往最佳,因為對於壓縮狀態會模糊掉的精準長程複製,注意力仍然更擅長。
又稱
另見