自監督與表徵學習

遮罩自編碼器

遮罩自編碼器(MAE)是遮罩影像建模一個格外乾淨且可擴展的實例。其配方在簡潔上近乎粗暴:隨機遮掉影像中極高比例的區塊,通常是 75%,再訓練一個編碼器—解碼器去重建缺失的像素。如此高的遮罩比例是刻意的,因為影像在空間上高度冗餘,只遮掉一點點會讓模型靠複製鄰近像素蒙混,而遮掉四分之三則迫使它必須推理全域結構才能重建。

使 MAE 能擴展的架構洞見在於其不對稱性。編碼器,一個大型視覺轉換器,只處理可見的那 25% 區塊,它甚至從不接觸遮罩標記。這讓昂貴的編碼器執行成本約降為四分之一,得以訓練像 ViT-Huge 這樣的超大模型。直到之後才插入學習而得的遮罩標記,並由一個刻意設計得輕量、淺層的解碼器重建整張影像。重建損失僅對被遮區塊的像素計算均方誤差(常對每區塊正規化後的像素計算,以小幅提升品質),預訓練後解碼器即被丟棄,只保留編碼器。

MAE 的重要性在於它讓遮罩預訓練同時變得簡單且高效到足以擴展,且微調後能在分類、偵測與分割上達到頂尖結果。其特徵性的取捨正是典型的 MIM 印記:凍結線性探測下偏弱,但微調下表現傑出,這與 SimCLR 等對比方法的平衡恰好相反。原因在於 MAE 最佳化的是重建而非實例判別,因此其特徵編碼了豐富的局部與結構資訊,需要一點點適配(而非僅一個線性層)才能就緒上任。

取一張 224x224 的影像,切成 196 個 16x16 的區塊。遮掉其中 147 個(75%);ViT 編碼器只吃進剩下的 49 個可見區塊。接著一個小型解碼器收到這 49 個編碼,加上 147 個共享的遮罩標記,輸出像素預測,並只在那 147 個被遮區塊上計分。

又称
MAE