多模態視覺語言

CLIP 模型

CLIP(Contrastive Language-Image Pre-training,對比式語言—影像預訓練)由 OpenAI 於 2021 年發布,是一種學會判斷「哪句描述配哪張影像」的視覺語言模型。它由兩個各自獨立的編碼器組成——影像編碼器(ResNet,或在強版本中是視覺 Transformer)與文字編碼器(Transformer)——各自輸出單一向量。CLIP 的訓練目標是讓一張影像的向量與其真實描述的向量相似,而與批次中其他所有描述都不相似。其巧妙之處在於:是用自然語言描述、而非固定類別標籤來當監督訊號,因此模型學到的是一種開放式的視覺概念。

訓練目標是對比式的:在一批 N 對影像—文字中,模型對每張影像與每段文字計算餘弦相似度,形成一個 N×N 矩陣,再以對稱交叉熵損失(並乘上一個可學習的溫度參數做縮放)來訓練,使 N 個正確成對成為各自所在列與行中數值最大的項。當批次達到數千時,每張影像會同時與數千個錯誤描述對比,這正是學到的空間如此具鑑別力的原因。CLIP 在約 4 億對從網路擷取的影像—文字(WIT 資料集)上訓練。

CLIP 的招牌能力是零樣本辨識(zero-shot recognition)。要把一張影像分類到它從未被明確訓練過的類別,你把每個類別寫成一個文字提示(「一張貓的照片」「一張狗的照片」),用文字編碼器嵌入這些提示,再挑出向量與影像向量最相似的那個。正因如此,CLIP 成為後續眾多系統的預設骨幹:它提供了開放詞彙偵測、文字生成影像的引導、CLIPScore 描述指標,以及許多多模態 LLM 內部視覺編碼器所使用的視覺編碼器與對齊文字空間。

CLIP 評估的是「匹配」,而非結構層次的「意義」:它大致表現得像一袋概念(bag of concepts),對屬性、計數與關係的處理很弱(它可能把「藍色球體上的紅色立方體」與相反順序搞混)。它也繼承了網路規模的偏誤。應把 CLIP 當成強大的相似度神諭,而非一個會推理者。

又称
Contrastive Language-Image Pre-training