多模態與視覺語言

圖文對比損失

圖文對比損失是 CLIP 式對齊背後的引擎:在一個大批次裡,每張影像與它真正的說明文字配成正例,並把批次中所有其他說明文字當成負例與之競爭。損失獎勵模型讓「相符的圖文配對」比所有「不相符的配對」更相似,於是訓練過程中兩個編碼器學會把對應的圖片與句子推向單位球面上的同一點,同時把其餘一切推開。

形式上它是定義在批次相似度矩陣上的對稱 InfoNCE 目標。每張影像與每段文字先被編碼並做 L2 正規化,所有兩兩之間的餘弦相似度再乘上一個可學習的溫度,接著做兩次交叉熵——一次以影像為查詢去比對文字,一次反過來。由於批次中其餘每個樣本都充當負例,梯度訊號會隨批次大小增長,這正是這類模型要在眾多加速器上、每步處理數萬配對的原因。

這個損失只要求「相符配對」排在「不相符配對」之上,並不保證幾何結構在其他方面合理,因而留下了模態差距與捷徑特徵的空間。難負例挖掘、捨去 softmax 正規化的 sigmoid 變體、以及說明文字品質,都會實質改變嵌入空間最終編碼了什麼。

\mathcal{L}=-\frac{1}{2N}\sum_{i=1}^{N}\left[\log\frac{e^{\langle u_i,v_i\rangle/\tau}}{\sum_{j}e^{\langle u_i,v_j\rangle/\tau}}+\log\frac{e^{\langle u_i,v_i\rangle/\tau}}{\sum_{j}e^{\langle u_j,v_i\rangle/\tau}}\right]

對 N 個配對的批次做對稱 InfoNCE:影像嵌入 u、文字嵌入 v、可學習溫度 tau。

又称
InfoNCE圖文對比損失CLIP loss