影像分類

CutMix 剪貼混合擴增 (cutmix)

CutMix 是一種區域性擴增,它從一張影像中剪下一塊矩形區塊貼到另一張影像上,然後把標籤設定為兩個類別依面積加權的混合。如果貼上的區塊覆蓋畫布的 30%,目標就變成背景影像類別的 0.7 加上區塊影像類別的 0.3。它可以看成兩個較早想法的融合:Cutout(刪除一塊區域)與 Mixup(內插標籤);但 CutMix 不是把區域歸零或半透明地混合像素,而是用另一張影像的真實內容填滿那個洞。

相較於 Mixup,其關鍵優勢是每個像素都來自真實影像,因此沒有鬼影般的半透明混合;這種剪貼迫使網路從部分視角辨識物體,並關注多個區域,從而同時改善定位與分類。依面積比例的標籤則讓監督保持誠實:模型只有在依各物體實際可見的比例分配信心時,才會得到獎勵。

CutMix 能穩定提升 ImageNet 的準確率與強健性,是現代訓練配方的常備項目,常與 Mixup 一起隨機套用,讓每個批次隨機接受其中一種擴增。它的超參數是控制區塊大小的 Beta 分佈,以及每個批次套用它的機率。

把一塊 32×32 的狗區塊貼到一張 224×224 的貓照片上;該區塊約覆蓋 2% 的面積,因此目標大約是 0.98 貓與 0.02 狗,而網路必須在有遮擋區塊的情況下仍然找出貓。