推論與服務部署
分頁鍵值快取(paged KV cache)
鍵值快取會隨著文字生成而長大,但你事先無法知道一個答案會有多長。早期系統替每個請求預留一整塊連續的記憶體,還是按最大可能長度來配置,結果大半都浪費掉。分頁借用了作業系統的虛擬記憶體技巧來終結這種浪費。
快取不再是一整塊連續區域,而是切成固定大小的區塊(頁),可以放在 GPU 記憶體的任何地方;每個請求各有一張區塊表,把邏輯上的詞元位置對映到實體頁。記憶體隨序列成長而一頁一頁地發放,幾乎消除了碎片化,也讓更多請求能共用同一張 GPU。額外的好處是:擁有共同前綴的請求可以指向完全相同的實體頁,同時省下記憶體,也省下原本要重新生成它們的預填充算力。
又称
另见