機器學習維運與生產

回退策略(rollback strategies,機器學習)

無論評估多麼謹慎,有些退步只會在生產中現形,因此決定性的問題不是壞模型會不會上線,而是你能多快把它撤回。機器學習的回退策略,就是那套有計畫、最好是自動化的機制,在生產指標越過危險閾值的當下,把服務還原到一個已知良好的先前模型,把一場潛在事故變成短暫且有界的閃失,而非一場拖長的故障。

一次乾淨的回退立基於三項保證。其一,先前的模型及其完整服務情境——權重、相匹配的特徵定義與前處理程式碼——都已版本化並隨時可重新部署,因為只還原模型卻不還原其特徵管線,會重新引入偏差。其二,一個支援即時流量切換的部署拓撲,藍綠環境或金絲雀路由器,使還原是一次路由變更,而非緩慢的重新部署。其三,自動化觸發器,由護欄指標與異常偵測器在凌晨三點無需等人就觸發回退。三者合起來,讓還原既快、既完整又可靠。

機器學習獨有的微妙之處在於:模型不是系統的全部。只回退權重,卻把一個已遷移的特徵儲存庫、一個已變更的提示或一個上游資料結構描述留在原地,可能讓你比先前更糟。成熟的回退會把模型、它的特徵與它的提示當成一個原子化的可部署單元,並演練還原,好讓它在壓力下真正需要時,是一次例行的按鈕操作,而非臨場的手忙腳亂。

又稱
model rollbacksafe reversion模型回退安全還原