評估、穩健性與倫理

領域適應

領域適應是分佈偏移的實務解答:你有一個針對來源領域的模型(或有標註資料),你希望它在另一個目標領域也能運作,而難處在於目標領域幾乎沒有、甚至完全沒有標註資料。例如:你有一個用標註豐富的合成遊戲引擎影像訓練的自駕感知模型(標籤便宜又充足),卻需要它在真實道路影片上運作(標註昂貴)。領域適應把來源學到的東西轉移過去,使其在目標領域奏效,而不必付出「從零標註目標」的全部代價。

這個設定通常依「你擁有多少目標監督」來界定。在無監督領域適應(UDA)——最常被研究、也最難的情況——你有標註的來源資料、卻只有未標註的目標資料;你必須僅憑目標影像、在沒有任何目標標籤下對齊兩個領域。半監督 DA 給你少量目標標籤;監督 DA 給你大量(此時就漸漸變成一般的遷移學習/微調)。整個問題只有在來源與目標共享相同標籤空間(相同的類別集合)、卻在外觀上不同時才有意義——合成對真實、白天對夜晚、某醫院的掃描儀對另一家的。

主導的思路是特徵對齊:訓練模型,使其在內部特徵空間中,來源與目標樣本變得無法區分,其理論是「建立在領域不變特徵上的分類器,對兩個領域都會奏效」。具體機制包括差異最小化——明確縮小來源與目標特徵分佈之間的統計距離(例如最大平均差異 MMD、對齊二階統計量的 CORAL)——以及對抗式對齊,即具影響力的 DANN 方法:一個領域分類器試圖分辨來源與目標特徵,而梯度反轉層則訓練特徵抽取器去騙過它,驅使特徵與領域無關。像素層級的方法則改為把影像跨領域轉譯(CycleGAN 風格),使來源影像在訓練前看起來像目標影像。

現代實務大量倚賴帶偽標籤的自我訓練(模型為有把握的目標樣本標上標籤並據以訓練,反覆迭代),常結合強增強與一致性正則化;這些主宰了 GTA5→Cityscapes 等語意分割適應基準。大型預訓練模型(CLIP 與其他基礎模型)的興起也改變了這個領域:它們廣泛的預訓練已涵蓋許多領域,因此提示(prompting)或輕量微調往往勝過經典對齊。關鍵的警示:適應可能遭遇負遷移(在領域標籤分佈不同時硬要對齊反而有害),而無監督方法之所以難以驗證,恰恰是因為你缺少目標標籤來衡量成效——在目標上做模型選擇是一個尚未解決的問題。

一個用 25,000 張標註的合成 GTA5 駕駛畫面訓練的分割網路,直接套用在真實 Cityscapes 影像上表現很差。無監督 DA——對抗式特徵對齊加上在未標註 Cityscapes 上的偽標籤自我訓練——能在零真實標籤下,把目標 mIoU 從 30 出頭拉升到接近 60。

又称
DAunsupervised domain adaptationUDA