自監督與表徵學習

遮罩影像建模

遮罩影像建模是把「讓 BERT 在語言上奏效的那個想法」翻譯到視覺:藏起輸入的一部分,訓練模型把空格填回去。你把影像切成一格格的區塊,隨機遮掉其中很大一部分,再要網路從仍看得見的區塊去預測缺失的內容。要做得好,模型就必須建立起對「影像如何構成」的內在理解,知道什麼通常會緊鄰什麼,才能為被藏起的區域虛構出合理的內容。

這是一種生成式或去雜訊式的自監督,相對於比較擴增視角的聯合嵌入家族(SimCLR、BYOL、DINO)。它天生的搭檔是視覺轉換器,因為 ViT 本來就在一串區塊標記上運作,所以遮掉某些標記、插入學習而得的遮罩佔位符相當直接。其監督是自動的,被遮區塊的真值就是原本在那裡的區塊,因此同樣不涉及任何人工標籤。

這個家族由「你對每個被遮區塊預測什麼」來區分。SimMIM 與 MAE 回歸原始像素值。BEiT 預測由預訓練影像分詞器產生的離散視覺標記。MaskFeat 預測手工的 HOG 特徵,data2vec 則從一個動量教師預測被遮區域的深層特徵。一個實務特徵是:遮罩影像建模的方法傾向產生「微調表現極佳」的特徵(在偵測與分割上往往最好),但在凍結線性探測下的分數低於對比方法,因為這些特徵雖豐富,卻不像對比特徵那樣立即線性可分。

又称
MIM