評估、穩健性與倫理

分佈偏移

分佈偏移是「在測試集上拿高分的模型,在真實世界卻失敗」的沉默原因:部署之後它遇到的資料,與訓練時的資料來自不同的分佈。幾乎所有機器學習背後的核心假設是「訓練與測試資料是來自同一底層分佈的獨立樣本」(即「i.i.d.」假設)。分佈偏移就是這個假設的破裂——而由於效能保證建立在它之上,當模型所見的世界不再吻合它所學的世界時,準確率可能急遽且無聲地退化。

在視覺領域,偏移有許多具體形式。相機改變(新感測器、解析度、JPEG 壓縮)、環境改變(用晴天白晝照片訓練的模型,卻在夜間、霧中或雪中測試)、損壞(動態模糊、雜訊、天候假影,如 ImageNet-C 基準所編目)、地理或人口改變(用美國農場訓練的作物病害模型用在肯亞)、或渲染/風格改變(照片到素描到繪畫,如 DomainNet)。危險的情況是細微偏移:影像在人眼中仍然「正常」,因此失敗不明顯,準確率卻悄悄下滑。

把偏移的種類形式化命名會有幫助。把聯合分佈寫成 P(x, y) = P(y|x)P(x),其中 x 為輸入、y 為標籤:協變量偏移(covariate shift)指輸入分佈 P(x) 改變、但標註規則 P(y|x) 不變(經典的視覺情況——新的光照、相同的物件);標籤偏移(label shift/先驗機率偏移)指類別頻率 P(y) 改變(測試時某類別變多);概念偏移(concept shift)指 P(y|x) 這個關係本身改變(同樣的輸入現在應得到不同標籤)。每一種都需要不同的偵測與矯正策略。

分佈偏移是把大半穩健性研究串連起來的總括問題。偵測它是「分佈外偵測」的工作;適應某個已知的目標分佈是「領域適應」;打造能在許多未見偏移下優雅退化的模型是「領域泛化」。ImageNet-C/-R、ObjectNet、WILDS、DomainNet 等基準正是為了量測它而存在,而一個發人深省、反覆出現的發現是:高的分佈內準確率並不保證對偏移的穩健性——模型可以同時在乾淨測試資料上是最先進、卻在溫和而現實的變化下脆弱,這正是為何偏移被當作第一等的評估軸線,而非事後補充。

要當心藏在你自己流程裡的偏移:訓練/測試的縮放或正規化不一致、各切分之間的標籤分佈差異,或測試集與訓練取自同一來源(這會掩蓋真實世界的偏移、灌水回報數字)。「在基準上有效」與「在部署時有效」是兩個不同的主張。

又称
dataset shiftdomain shiftcovariate shiftout-of-distribution data