多模態與視覺語言

視覺語言預訓練(VLP)

視覺語言預訓練讓模型同時學會「看」與「讀」。做法是餵給它從網路蒐集來的海量圖文配對,要它在還沒看到任何特定任務之前,就先搞懂圖片與文字之間的關聯。期望是:消化過幾億張帶說明文字的照片後,模型已經建立起一個共享的語意空間,讓「狗」這個詞與一張狗的照片落在相近的位置,於是下游任務(如看圖說話或檢索)只需要輕度微調即可。

具體而言,一套 VLP 系統會把視覺編碼器與文字編碼器(或一個融合用的 transformer)配在一起,並在配對資料上最佳化一個或多個自監督目標:圖文對比配對、以影像為條件的遮罩語言建模、把圖文配對當成二元分類器來判斷是否相符,有時還加上看圖說話。其定義性特徵是:監督訊號來自影像與其替代文字或說明文字的自然共現,而非人工標注的框或類別標籤,這正是資料能擴張到數十億配對的原因。

VLP 是一個總稱,雙編碼器模型(如 CLIP)、融合編碼器模型、以及編碼器-解碼器生成模型都歸在它底下。它的核心難題是雜訊:網路替代文字往往簡短、籠統、甚至錯誤,因此很大一部分訓練訊號相當微弱,與其盲目擴大規模,整理或重新標注語料常常帶來更大的收益。

預訓練品質受限於說明文字品質更甚於模型大小;對網路影像進行合成式重新標注,如今已是標準且高槓桿的一步。

又称
VLP視覺語言預訓練image-text pretraining