推論與服務部署

連續批次處理(continuous batching)

請求在不同時刻抵達,也在不同時刻完成。傳統的靜態批次會湊一組固定的請求一起跑,在最慢的成員跑完前拒絕讓任何新請求加入——於是快的請求被慢的綁架,而每當有序列提早完成,GPU 就閒置一半。

連續批次改以單一解碼步驟為排程粒度。每一步之後,完成的序列離開批次,剛抵達的立刻加入,於是 GPU 在工作量允許的範圍內始終保持滿載。再搭配分頁鍵值快取,它能在真實、爆量起伏的流量上大幅拉高吞吐量,又不必逼任何一個請求乾等一整批湊齊。這幾乎是每一個現代服務引擎背後的核心排程理念。

又稱
in-flight batchingiteration-level scheduling