推論與服務部署

大型語言模型服務框架(LLM serving frameworks)

你大可以寫一個簡單迴圈,一個詞元一個詞元地呼叫模型,但要替數千名同時上線的使用者高效地做這件事,是一個正經的系統問題。服務框架就是那些正式上線的引擎——vLLM、TensorRT-LLM、TGI、SGLang 等等——它們把困難的部分打包好,讓你不必重新發明。

這些系統把分頁鍵值快取、連續批次、最佳化的注意力與矩陣乘法核心、量化、推測解碼、張量平行,以及一個 OpenAI 風格的 HTTP API 全部整進一台伺服器。它們把原始的模型權重變成一項服務,在仍要達成延遲目標的同時,把 GPU 使用率與吞吐量推到最高。選哪一個是在峰值效能、硬體支援、易用性與功能涵蓋度之間權衡;實務上它們是大規模部署大型語言模型的預設方式,而如今許多服務研究都先以這些框架裡的一個功能形式發布。

又稱
inference enginesvLLM, TensorRT-LLM, TGI, SGLang