評估、穩健性與倫理

資料集偏誤

資料集偏誤指的是這個原則:模型只能學到它資料裡有的東西——包括資料的瑕疵、偏斜與偶然模式——而它會忠實地重現、且常常放大它們。一個視覺資料集並非世界的中立鏡子;它是一個被「由誰、在何處、用什麼相機、拍了誰、依什麼標註指示」所塑造的樣本。在那個樣本中被過度呈現、呈現不足、或偶然相關的一切,都會成為模型優化所朝向的「真相」,即使那個真相是收集過程的人造產物、而非任務的真實性質。

偏誤透過數個具體管道進入。選擇/抽樣偏誤:訓練影像主要爬取自某些國家、語言或網站,因此資料在地理與人口上偏斜(網路影像集歷來過度呈現北美與歐洲)。呈現偏誤:某些族群、膚色、光照條件或物件視角出現得少得多,模型對它們的訓練也就更少。標籤偏誤:標註指引、模稜兩可的類別、或標註者自身的假設,把主觀判斷烤進了「真實標籤」。拍攝偏誤:取景與攝影慣例造成假影(物件總是置中、某些背景總與某些類別配對)。

最陰險的後果是虛假相關——捷徑學習。若在資料中,牛幾乎總是出現在草地上、駱駝出現在沙地上,分類器可能學成「綠色背景 ⇒ 牛」,而非學會牛長什麼樣子,然後把海灘上的牛分類錯誤。著名的診斷案例觸目驚心:一個「哈士奇對狼」的分類器其實是依背景中的雪來判斷;醫療模型偵測到的是某醫院 X 光機的浮水印、而非疾病。這些模型在「共享同一偏誤」的測試集上得高分,然後在虛假線索一旦缺席的瞬間崩潰——這恰恰是分佈偏移的偽裝。

放大效應使情況更糟:模型常誇大資料中既有的相關,把一個偏誤關聯預測得比基率還強,而當模型輸出成為未來的訓練資料時,這會在回饋迴路中複利累加。緩解一部分是技術性的——對類別與族群重新平衡或重新加權、針對性地收集資料來補洞、增強、優化最差群組而非平均損失的群組分佈穩健優化(Group DRO)、以及抑制已知虛假特徵的去偏方法——但它本質上也關乎流程:為資料集建檔(datasheets、model cards)、跨子群組稽核,並體認到沒有任何純演算法的修法能替代「具代表性的資料與仔細的標註」。資料集偏誤是許多下游不公的上游根源,這正是它被當作倫理與評估議題、而不僅是工程上的麻煩來看待的原因。

要當心「印證偏誤的測試集」:若你的測試資料以與訓練相同的方式收集,它就共享同樣的偏誤,因此不會揭露捷徑學習——反而會印證它。探查虛假線索需要刻意偏移過的評估(脫離情境的物件、平衡的子群組、反事實編輯),而不只是一個保留切分。

又称
data biasselection biasspurious correlationshortcut bias