機器學習維運與生產
推論自動擴縮(inference autoscaling)
送往已部署模型的流量很少是平的:它在尖峰時段湧現、在深夜退潮,而一支按尖峰規模配置的機隊浪費金錢,按平均配置的則在需求暴衝時錯失延遲目標。推論自動擴縮會依負載上下調整服務副本(或加速器)的數量,追逐一個目標——以可持續的最低成本滿足延遲服務水準目標。它就是讓模型既夠快又負擔得起的控制迴圈。
自動擴縮器觀察一個訊號——每秒請求數、佇列深度、GPU 使用率或量測到的尾端延遲——並將它與一個目標比較,訊號過熱時增加副本、冷卻時移除副本。機器學習服務讓教科書式的網頁自動擴縮變得複雜:模型容器把龐大權重載入 GPU 可能要數分鐘,因此冷啟動延遲嚴重;加速器顆粒粗且昂貴,無法以單個小單位來擴縮;而吞吐量取決於批次處理,較大批次提高使用率卻也拉高每請求延遲。因此有效的自動擴縮會把批次大小、副本數與擴展時機一起設計。
決定性的取捨是延遲、成本與餘裕的三角。擴得太積極,你會為了一場可能不來的暴衝而閒置加速器、燒掉金錢;擴得太懶散,一場真正的暴衝會在新副本暖機前就衝破延遲服務水準目標。實務系統會保留一塊按預期突發性配置的暖緩衝、依預測性與反應性訊號一起擴縮,並可能優雅降級(換較小模型、拉長佇列),而非直接違反服務水準目標。
又稱
另見