多模態視覺語言

BLIP 模型

BLIP(Bootstrapping Language-Image Pre-training,自助式語言—影像預訓練)由 Salesforce 於 2022 年提出,是一種設計成在同一框架內既擅長理解任務(檢索、VQA)又擅長生成任務(描述)的視覺語言模型——而 CLIP 只做匹配、不做文字生成。它的架構稱為多模態編碼器—解碼器混合體(Multimodal mixture of Encoder-Decoder,MED),能以共享權重在三種模式下運作:單模態編碼器(CLIP 式對比匹配)、影像條件文字編碼器(用於影像文字匹配),以及影像條件文字解碼器(用於生成描述)。

BLIP 的招牌貢獻是 CapFilt,一種用模型自身來清理嘈雜網路資料的資料自助法。網路描述常常不準確,於是 BLIP 微調出一個描述器,為網路影像產生新的合成描述,以及一個過濾器,丟棄(無論網路或合成的)實際上與影像不匹配的描述。在這份經自助提升、品質更高的資料上訓練能明顯改善結果——這正是名稱中「bootstrapping(自助)」的由來:模型改善了自己的訓練集。

BLIP-2(2023)從效率角度重新構想此問題:保留一個強大的凍結影像編碼器與一個凍結的大型語言模型,只訓練兩者之間一個稱為 Q-Former(Querying Transformer,查詢式 Transformer)的小型橋接器。Q-Former 持有一組固定且可學習的查詢 token,抽取與語言最相關的視覺特徵並餵給 LLM,因此 BLIP-2 以極少量的可訓練參數達到強大的描述與 VQA 表現。這種「凍結編碼器+小型學習連接器」的模式對後續的多模態 LLM 影響巨大。

又称
Bootstrapping Language-Image Pre-trainingBLIP-2