電腦視覺

CLIP與視覺-語言模型(CLIP and vision-language models)

/ klip and VIZH-un LANG-gwij MOD-uls /

CLIP及其同類,教會機器在一個共享的空間裡把圖片和文字聯繫起來。其訓練思路很優雅:從網上搜集數億張本就帶有文字說明的圖像,再訓練兩個網路——一個讀圖,一個讀文——讓一張照片和它真正的說明落得很近,而一張照片和一句錯誤的說明則落得很遠。訓練之後,模型就能把任意圖像和任意句子都放進同一張「意義地圖」裡,並衡量它們有多匹配。「一張狗的照片」會落在狗的圖片附近。

這解鎖了一種強大的能力:零樣本辨識。因為模型把圖像關聯到了開放的語言,而不是一份固定的類別清單,你給一張圖分類時,只需把候選標籤寫成句子,再問圖像離哪一句最近就行——為新類別無需重新訓練。同樣這種「圖文對齊」,正是讓文生圖生成器讀懂提示詞的引擎,也驅動著「按描述搜照片」,並構成了那些能討論你上傳的圖像的多模態聊天助手的視覺前端。

要誠實地說清這種「匹配」是什麼、不是什麼。CLIP衡量的是從網際網路上抓取的視覺模式與文本模式之間的統計關聯;它並不理解、也不會推理一個場景。它在數數、空間關係(「書左邊的那個杯子」)、圖像內的文字,以及任何不像它網路訓練數據的東西上都很吃力,還會把網際網路的偏見與刻板印象整批繼承下來。它也很容易被對抗性的或分布外的輸入騙倒。所以視覺-語言模型是連接「看見」與「描述」之間一座靈活得驚人的橋——但一個很高的匹配分數,是相關性,而非理解。

給CLIP看一張你寵物的照片,再給它三句話:「一張貓的照片」「一張狗的照片」「一張兔子的照片」。它會算出圖像離每一句有多近,並選出最高的那個——比如貓0.31、狗0.02、兔子0.01——從而在從未用過這些確切標籤訓練的情況下完成分類。但若改問它「兩隻貓」還是「三隻貓」,它往往就分不清了。

把標籤寫成句子來分類——很靈活,但數數和空間關係會暴露它的局限。

圖文對齊是相關,而非理解:CLIP式的模型在數數、左右與內外關係、以及讀取圖中文字上會穩定地失敗,還會繼承網路規模的刻板印象。一個很高的圖文匹配分數,意思是「這些模式傾向於一起出現」,而不是「模型理解了這個場景」。

又稱
CLIPcontrastive language-image pretrainingvision-language modelVLM视觉语言模型視覺語言模型