機器學習維運與生產
機器學習測試評分(ML test score)
傳統軟體對「可上生產」有一套用熟了的檢查清單,但一個機器學習系統可能全數通過卻仍是個負債,因為它的品質活在程式碼沒有表達出來的資料與行為裡。機器學習測試評分出自 Google 一篇談機器學習生產就緒度評分表的論文,是一張結構化的計分卡,針對機器學習系統會無聲腐爛的各個面向——資料、特徵、模型開發、基礎設施與監控——提出尖銳的問題。每個問題依「已實作」且「已自動化」兩者得分,而得分最低的類別決定了你整體成熟度的上限。
這份評分表把測試分成四個領域。資料與特徵測試檢查結構描述、分布、特徵重要性與隱私。模型開發測試涵蓋再現性、離線對線上指標的對應,以及對退步的防護。機器學習基礎設施測試涵蓋訓練的再現性、整條管線的整合,以及回退的能力。監控測試檢查訓練與服務偏差、漂移、過時,以及生產中的數值穩定性。把每一項評為手動、自動化或缺席,得出一個讓技術債變得可見、且能跨團隊比較的數字。
它的價值與其說是那個確切分數,不如說是它強迫進行的對話:一個擁有高準確度模型、卻無法重現其訓練、無法偵測偏差、也無法回退的團隊,依這份評分表而言並非生產就緒,無論離線指標看起來多好。這個分數把可靠性重新定義為整個系統及其測試的性質,而不只是模型準確度一項。
又稱
另見