現代大型語言模型架構內部
Mamba 與狀態空間模型(Mamba / state-space model)
狀態空間模型不去把每個詞元和其他每個詞元相比,而是像一個人做筆記那樣讀序列:它保有一份小小的、固定大小的運行記憶(隱藏狀態),逐詞元更新,邊走邊決定要留下什麼、忘掉什麼。Mamba 是這個想法的大型語言模型等級版本,由於記憶大小固定,無論序列已經多長,處理每個新詞元的成本都一樣。
其數學是一條借自控制理論的線性遞迴,但 Mamba 讓它的更新閘門依當前輸入而定,這種選擇性正是它能挑選要記住什麼的關鍵,而一個巧妙的平行掃描讓它儘管本質上是遞迴的,訓練起來仍能和 transformer 一樣快。回報是每個詞元的記憶體固定、生成時間線性,非常適合很長的序列。取捨在於,單一壓縮狀態可能難以應付需要精確回憶任意早期詞元的任務,這正是純 Mamba 常與少數注意力層混搭的原因。
又称
另见