影像分類
Mixup 混合擴增 (mixup)
Mixup 是一種資料擴增兼正規化的方法,它讓網路在成對樣本的線性混合上進行訓練。對於兩張訓練影像及其 one-hot 標籤,它以凸組合構造出一個新的訓練樣本:混合影像等於 lambda 乘以第一張影像,加上(1 減 lambda)乘以第二張影像,而混合標籤則是兩個標籤向量的同一加權平均。混合權重 lambda 對每一對樣本都從一個 Beta 分佈中隨機抽取。
由於像素與目標都被內插,模型被要求對一張 70/30 像素混合的影像預測,比方說,70% 是貓、30% 是狗。這鼓勵網路在訓練樣本之間呈現線性行為,經驗上能平滑決策邊界、減少對雜訊標籤的死記、改善泛化與校準,並提高對對抗性擾動的強健性。
Mixup 成本低、與架構無關,且能與標準擴增良好搭配,因此常見於強力的分類配方中。它主要的微妙之處在於:混合後的影像可能看起來不自然,而過於激進的 Beta 參數(也就是混合過重)可能造成欠擬合;實務上會調整 Beta 的集中度,通常落在 0.2 左右,並常把 mixup 與它在空間上的表親 CutMix 搭配使用。
以 lambda = 0.6 的貓影像與 0.4 的狗影像混合;網路的目標變成「貓」0.6、「狗」0.4,教導它:部分的混合應該產生部分的信心,而不是單一、過度自信的標籤。