推論與服務部署
FlashAttention(IO 感知注意力核心)
天真的注意力實作會在緩慢的 GPU 記憶體裡建出完整的分數矩陣——每個詞元對每個詞元都比一遍——然後再讀回來套用 softmax。對長序列而言,那個矩陣大得驚人,而瓶頸是進出記憶體的次數,不是算術本身。
FlashAttention 是一個 IO 感知的核心,它根本不把完整的注意力矩陣寫進主記憶體。它把運算切成小到能塞進晶片上快速 SRAM 的方塊來串流,把分數、softmax 與值加權融合成一次傳播,並用線上 softmax 技巧讓跨方塊的累計值保持正確。結果在數學上是一模一樣的注意力輸出,但進出記憶體的次數大幅減少——帶來大幅加速與低得多的記憶體用量。在服務上,這正是讓長提示與長脈絡得以被預填充處理的關鍵。
又称
另见