多模態視覺語言

影像文字檢索

影像文字檢索(image-text retrieval)是一種跨模態搜尋任務:給定一段文字查詢,找出與其匹配的影像(文字到影像檢索);或給定一張影像,找出描述它的字句或文件(影像到文字檢索)。這就是「打一段描述來搜尋照片」背後的技術。核心概念是共享嵌入空間(shared embedding space):視覺編碼器把每張影像映射成一個向量,文字編碼器把每個句子映射成一個向量,兩者都進入同一個高維空間,並安排成讓匹配的影像與描述落在很近的位置,而不匹配的成對則落得很遠。

「近」是用餘弦相似度(cosine similarity)衡量——即兩個向量夾角的餘弦值,當兩者指向同方向時數值較大。要檢索時,你把查詢嵌入一次,計算它與每個候選項預先算好的嵌入之間的相似度,再回傳分數最高的幾個。由於每個項目都是獨立嵌入的,這種雙編碼器(雙塔,two-tower)設計可擴展到數十億項:嵌入可事先建立索引,並用快速的近似最近鄰方法搜尋。另一種做法是交叉編碼器(cross-encoder),對每個影像—文字成對做聯合處理(更準確,例如一個影像文字匹配頭),但對所有項目逐一評分太慢,因此常只用來對雙編碼器回傳的前段候選做重新排序。

檢索品質以 Recall@K 回報——即正確匹配出現在前 K 個結果中的查詢比例(R@1、R@5、R@10 為標準)。基準包括 Flickr30K 與 MS COCO。訓練使用帶困難負例(hard negatives)的對比目標:模型看到一個真實成對加上一些干擾項,學習把真實成對評為最高分;挖掘困難負例(語意接近但其實錯誤的干擾項)能讓嵌入空間更銳利。CLIP 讓強大的檢索能力作為對比預訓練的副產品免費浮現。

查詢「一個孩子吹生日蠟燭」:文字編碼器產生一個向量;系統依餘弦相似度對一百萬張預先嵌入的照片排序,回傳前 10 名。若目標照片排在第 1 名,則 R@1 = 1。

又稱
cross-modal retrievalimage-text matching