表徵與自監督學習
遮罩自編碼器(MAE)
想像把一幅馬賽克的四分之三磁磚撕掉,再請人從殘存的少數磁磚把缺塊重新補畫出來。要補得令人信服,他必須先理解這個場景是什麼——一張臉、一隻狗、一條街。遮罩自編碼器把這件事變成影像的前置任務:把畫面大半遮住,逼網路把它補回來,而它在過程中建立的表徵,竟成為下游分類、偵測與分割的優秀特徵。
具體做法是把影像切成不重疊的區塊,並隨機丟棄其中很高的比例(常用 75%)。一個不對稱的設計是關鍵:視覺轉換器(ViT)編碼器只處理那一小撮可見區塊,因此預訓練很省,而一個輕量解碼器接收編碼器輸出加上被丟棄位置的可學習遮罩符元,在那些位置重建原始像素。損失只計算被遮罩區塊的均方誤差。預訓練後解碼器即丟棄,編碼器再做微調或線性探測。
高遮罩比例是最關鍵的設計選擇:自然影像在空間上高度冗餘,輕度遮罩會讓模型靠插補鄰居作弊,而高強度遮罩才逼出真正的語意推理。MAE 是遮罩語言建模的視覺對應,只是重建的是連續像素而非離散符元,這也是為何以逐區塊正規化後的像素為目標,比預測符元更利於微調。
\mathcal{L} = \frac{1}{|\mathcal{M}|}\sum_{i\in\mathcal{M}} \lVert \hat{x}_i - x_i \rVert_2^2
重建損失只在被遮罩的區塊集合 \mathcal{M} 上平均。
不對稱很重要:把遮罩符元送進深層編碼器(如早期 BEiT 風格設計)既拖慢訓練,又造成訓練與測試的落差,因為真實的下游影像並沒有遮罩符元。
又称
另见