推論與服務
TTFT 與 TPOT 指標(TTFT and TPOT metrics)
大型語言模型的服務無法用單一個延遲數字概括,因為生成有兩個在感受上截然不同的階段。首 token 時間(TTFT)是使用者送出提示後、第一個字出現前要等多久;它主要由 prefill 傳遞與排隊決定,並界定了系統感覺有多靈敏。每 token 產出時間(TPOT),又稱 token 間延遲,是後續 token 串流而出的穩定節奏;它主要由記憶體受限的 decode 步驟決定,左右文字讀起來是流暢還是頓挫。
這兩者是服務堆疊的核心服務水準目標,而且關鍵在於它們會與吞吐量、也彼此互相權衡。更大的批次與連續批次能提高每秒總 token 數,卻可能拉長任一單一請求的 TPOT;一個巨大提示的 prefill 若不分塊,就會頂高別人的 TTFT。一段 N 個 token 回應的端到端延遲,可良好地模型化為 TTFT 加上 N 乘以 TPOT,因此這兩個指標合在一起,讓營運者得以設定並驗證 SLO,並針對特定百分位推敲尾端行為。
只報單一個平均值會藏住尾端:在真實並發下的 P99 TTFT 與 P99 TPOT,才是真正主宰使用者體驗的東西。
T_{\text{end-to-end}} \approx \mathrm{TTFT} + (N-1)\cdot \mathrm{TPOT}
N 個 token 回應的總延遲,可拆解為首 token 的等待加上每 token 的串流節奏。
TTFT 是 prefill/排隊指標,TPOT 是 decode 指標——它們由不同技術優化,所以一套堆疊可能一個很強、另一個很差。
又称
另见