推論與服務部署
吞吐量與延遲(throughput vs. latency)
評斷服務系統的兩種方式拉向相反方向。延遲是單一使用者等答案要等多久;吞吐量是整個系統替所有人每秒產出多少詞元。讓單一使用者更快,和同時服務最多使用者,根本是兩個不同的目標。
較大的批次把「從記憶體讀權重」的成本攤分到許多請求上,拉高總吞吐量並降低每詞元成本——但每個請求現在得等批次湊齊,又要共用算力,於是它的延遲上升。小批次則恰好相反。真實系統靠連續批次、明確的延遲目標(服務水準目標),有時還靠把互動流量與批量流量分到不同機群,來權衡這件事。沒有單一最佳工作點;你要根據自己是在優化使用者體驗,還是在優化每詞元的成本來抉擇。
另見