推論與服務部署

批次推論與線上推論(batch vs. online inference)

兩個非常不同的工作共用同一個模型。線上推論,或稱即時推論,回答的是此刻正在等待的使用者,所以延遲就是一切。批次推論,或稱離線推論,在沒有人盯著的情況下慢慢輾過一大堆輸入,所以只有總成本與吞吐量要緊。

線上服務優化的是低首詞元時間與穩定串流,持續運行,並接受稍低的 GPU 使用率以壓住尾端延遲。批次處理——標註資料集、生成嵌入、摘要一百萬份文件——可以用非常大的批次、填滿每一個 GPU 週期、跑在較便宜且可被中斷的硬體上,並容忍數分鐘甚至數小時的延遲。許多供應商正是因為這個原因,把批次推論的定價訂得遠低於線上。同一組權重服務兩者;完全不同的是排程與經濟帳。

又称
offline vs. real-time inference