監控與可觀測性
這兩個詞常被混用,而其區別很重要。監控(monitoring)是拿已知訊號去比對已知門檻——延遲、錯誤率、預測量,也就是你在第一卷見過的模型監控(model monitoring)。它回答你事先想到要問的問題。可觀測性(observability)則是更豐富的性質:擁有足夠的儀表化,讓你能在某件意外發生之後,對運行中的系統提出新問題——而不必上線新程式碼去蒐集更多資料。
模型可觀測性(model observability)為整條路徑——輸入、特徵、原始預測、後處理,以及(最終的)結果——做儀表化,好讓一次退化能被診斷,而不只是被偵測。試金石:當準確率下降時,你能否在不寫新日誌的情況下,按區隔、特徵值與時間切分這次失敗?若能,你擁有可觀測性;若你必須重新部署才能調查,那你當初只有監控。
漂移偵測:逮住世界在移動
機器學習最典型的失敗沒有例外(exception):程式碼沒問題、模型沒問題,但世界變了。漂移偵測與監控監看兩種不同的位移。資料(共變量)漂移是輸入分布 P(x) 的改變——一款新裝置湧入、某特徵的單位在上游改了。概念漂移(concept drift)則是關係 P(y|x) 的改變——相同的輸入如今對應不同的正確答案,例如詐騙手法演進時。這正是第一卷的分布位移(distribution shift),如今被落實為一個連續的生產訊號。
- 固定一個參考分布:訓練時(或一個可信的近期)特徵分布。
- 在即時流量的滾動視窗上,逐特徵估計當前分布。
- 用統計距離(族群穩定度指標 PSI、KS 檢定或類似方法)為散度評分。
- 當散度越過門檻時告警——並把訊號餵給持續訓練的觸發器。
用散度衡量漂移:以 KL 散度等統計距離來度量即時特徵分佈 P 相對固定參考分佈 Q 偏移了多少。
打造模型可觀測性
具體而言,可觀測性意味著為抽樣的一部分請求記錄這份連接後的紀錄:輸入 id、所服務的特徵向量、模型版本、原始分數、最終決策、延遲,以及——當它到達時——最終的標籤。這份連接日誌是一切的原料:漂移分數、偏移檢查、切片分析,以及事後的模型除錯(model debugging)。藝術在於抽樣到足以具統計意義、並能捕捉罕見區隔,同時又不至於記錄過量、使儲存與隱私成本爆炸。
if sample_gate(request_id): # e.g. 5% + always-log rare segments
obs.log({
'request_id': request_id,
'model_version': version_key,
'features': served_features, # enables skew + drift checks
'score': raw_score,
'decision': final_action,
'latency_ms': dt,
'label': None}) # joined later when ground truth lands可觀測性也涵蓋分布外偵測(out-of-distribution detection):你不只問「整體分布漂移了嗎?」,還要標記出看起來不像訓練中任何東西的個別輸入。一個被標為 OOD 的請求是一個訊號:棄答、交給人類,或降低信心——把一個無聲而自信的錯誤,轉成一個可見且被處理的不確定性。
分佈外偵測:當某個輸入到訓練特徵分佈的馬氏距離異常大時,將其單獨標記出來。
為生產就緒度評分:機器學習測試分數
你怎麼知道自己的維運實務真的好,而不只是忙碌?機器學習測試分數(ML test score)是一套量表——由一篇知名的 Google 論文推廣——它沿四個軸為機器學習系統評分:針對資料的測試(結構描述、分布、特徵歸屬)、針對模型的測試(離線指標、公平性切片、過時度)、針對基礎設施的測試(可重現訓練、回滾、整合測試),以及監控(漂移、偏移、所服務特徵的健康度、延遲)。每項檢查得分;得分最低的那一軸,就是你最弱的一環。
這分數的價值,與其說是那個數字,不如說是它逼出的對話:它讓隱形的可靠性工作變得可見、可在團隊間比較,並讓那些難堪的缺口浮現——「我們有很棒的離線指標,卻沒有偏移測試、也沒有演練過的回滾」——這些缺口,否則只會由事故以慘痛方式揭露。把低分當成排好優先序的待辦清單,而非一個成績。
從告警到行動
若一則告警只是替沒人讀的吵雜儀表板再添一筆,監控就毫無價值。把迴圈閉合:每個訊號都必須導向一個已定義的回應。輸入漂移超過門檻 → 觸發一個持續訓練候選。即時模型的護欄被突破 → 自動回滾。OOD 激增 → 提高棄答率並呼叫值班。偏移告警 → 凍結升級,直到特徵路徑被調和一致。
帶有漂移偵測與再訓練回饋迴路的 MLOps 生命週期示意圖。
至此我們已能為模型做版本管理、重訓、上線與監看。最後一篇把鏡頭拉廣,對準主宰真實生產的兩股壓力:成本與規模(在延遲 SLO 下便宜地服務)與信任(治理、稽核)——再加上大型語言模型時代疊在這一切之上的維運新轉折。