多模態與視覺語言

模態差距

模態差距是關於 CLIP 這類聯合訓練嵌入的一個出人意料的幾何事實:儘管對比損失理應把影像與文字對齊到同一個共享空間,影像嵌入與文字嵌入其實並不交融。相反,每個模態各自住在自己狹窄的錐體裡,兩個錐體分隔而立、之間留著明顯的縫隙,於是一張貓的圖片與「一隻貓」這幾個字,在損失所在意的「相對」意義上很近,在全域上卻彼此遙遠。

這道差距源於兩股力量。在初始化時,帶正規化的深層網路會把輸出映射到超球面上的狹窄錐體,而由於兩個編碼器一開始落在不同的隨機錐體裡,它們起步就相距甚遠;對比溫度接著「保留」而非「彌合」這種分隔,因為損失只需要相符配對排在不相符配對之上,而它在維持兩模態全域位移的同時就能達成此事。結果是影像流形與文字流形之間有一個大致固定的偏移向量。

這道差距不只是趣聞:它形塑了檢索——其中的比較通常是「同模態內」或「相對」而非絕對的;它使那些試圖把文字嵌入換成影像嵌入(或反之)的方案變得複雜;而它也可被刻意彌合甚至加以利用,因為沿著差距方向平移嵌入,已被用來改善零樣本與生成行為。它提醒我們:一個共享空間未必是一個同質的空間。

這個共享嵌入空間只在對比損失所強制的「相對」意義上是共享的;影像與其說明文字之間的絕對距離,主要由那個固定的模態間偏移所支配。

又称
modality gap模態差距embedding cone gap