自監督與表徵學習
BEiT
BEiT(Bidirectional Encoder representation from Image Transformers)是最忠實地仿照 BERT 的遮罩影像建模方法,因為它預測的是離散標記而非連續像素。它所處理的關鍵難題是:語言天生有一套可供預測的詞彙,但影像只有連續的像素值,那麼被遮區塊的離散目標該是什麼?BEiT 的答案是:先用一個獨立、預訓練好的影像分詞器把影像轉成一串離散視覺標記,再去預測這些標記。
具體而言,訓練時每張影像有兩種表示。區塊視圖餵入視覺轉換器,而視覺標記視圖則來自一個離散變分自編碼器分詞器(BEiT 使用了 DALL-E 的 dVAE),它把每個區塊區域映射到一個固定碼本中的索引,碼本大小例如 8192 個視覺詞。預訓練時你遮掉一部分輸入區塊,ViT 必須預測每個被遮區塊的碼本索引,也就是其視覺標記。這是一個對碼本的分類問題,以交叉熵訓練,直接類比於 BERT 預測被遮詞的 ID。
預測標記而非像素的動機是:原始像素回歸會把模型容量花在重現高頻、低階的細節(精確紋理、雜訊)上,而這些並不太具語義。藉由強制預測離散、已被抽象化的視覺標記,BEiT 把模型推向更高階的結構。代價是它依賴一個另外訓練的分詞器,多了一個階段與一個設計選擇;後來的方法如 MAE 顯示,搭配高遮罩比例與不對稱編碼器的單純像素重建,無需任何分詞器也能具競爭力,而 BEiT v2 則改良分詞器,改用更具語義、經蒸餾的目標。
又称