推論與服務部署

每秒詞元數(tokens per second)

一旦字開始串流,每秒詞元數就是它們持續冒出來的速度。對單一使用者,它決定了答案讀起來的速度感;對整座叢集,總量版本則衡量系統總共完成了多少工作。這兩個數字很容易混淆,而且往往差很多。

單一請求的解碼速度主要由記憶體頻寬決定:每個詞元都要把模型權重和鍵值快取從 GPU 記憶體重讀一遍,所以每秒詞元數大約等於記憶體頻寬除以每個詞元讀取的位元組數。這正是為什麼量化與較小的鍵值快取能加速解碼,也是解碼被稱為記憶體受限的原因。整個系統的吞吐量——一整批次每秒的總詞元數——是另一個數字,可以高得多,因為讀權重的成本被攤分到整批,所以看到一個速度時,永遠要確認它是單一請求的還是總量的。

又称
TPSinter-token latency