對比式影像文字預訓練
對比式影像文字預訓練是 CLIP 及其後繼者背後的訓練策略:取數百萬到數十億對影像—描述,教兩個編碼器把匹配的成對放進共享嵌入空間中彼此相近的位置,同時把不匹配的成對推開。「對比(contrastive)」是核心概念——模型不是靠預測精確的像素或精確的字詞來學習,而是靠把一個正確配對與許多錯誤配對相對比,學會區分兩者的差異。這就繞過了對人工標註類別的需求:本就附在網路影像上的描述即是監督訊號。
標準損失是對稱套用的 InfoNCE。在一批 N 對中,把每張影像的真實描述視為唯一正例,其餘 N−1 個描述為負例;對相似度分數做 softmax,使模型因把正例排到最高而獲得獎勵,並對每段描述在各影像上做對稱的處理。相似度是餘弦相似度再除以溫度 τ(一個可學習的純量,控制模型把正例與負例分開的銳利程度)。由於負例來自同一批次(批次內負例,in-batch negatives),批次越大代表負例越多、訊號越好——這正是這類模型要在許多加速器上用極大批次訓練的原因。
在 CLIP 之外,重要變體包括 ALIGN(Google),它證明這套做法在十億對嘈雜、未經篩選的替代文字(alt-text)上也可行,以資料乾淨度換取規模;以及 SigLIP(Google),它以逐對的 sigmoid 損失取代 softmax/InfoNCE,免去對整批做正規化的需求,使較小批次也能高效訓練。其通則——以規模化的方式把匹配與不匹配相對比來對齊兩個模態——已成為多模態 AI 的一種基礎性預訓練範式。
對比式預訓練學的是對齊,而非生成:它能告訴你影像與文字匹配得多好,卻無法自己寫出描述。要做描述或對話,你需要一個生成頭或一個連接的語言模型(BLIP、Flamingo、LLaVA)。此外,溫度 τ 影響極大——太高會使空間崩塌,太低則訓練不穩定。