多模態視覺語言
開放詞彙偵測
開放詞彙偵測(open-vocabulary detection,OVD)是一種不受訓練時固定類別清單限制的物件偵測——即圈出物件並為其命名。在 COCO 上訓練的經典偵測器恰好認得 80 個類別,永遠無法輸出「獨角鯨」或「消防栓蓋」。開放詞彙偵測器能在推論時偵測你用文字命名的任何類別,包括它從未被訓練去偵測的類別,做法是把它的視覺區域特徵與一個文字嵌入空間對齊。
核心技巧是把偵測器固定的分類層(每個已知類別各一組學到的權重)換成由視覺語言模型(如 CLIP)產生的類別名稱文字嵌入。偵測器仍提出區域並為每個區域抽取一個特徵;分類於是變成:計算每個區域特徵與每個候選類別名稱嵌入的相似度,指派最佳匹配。由於你可以嵌入任何文字,你就能偵測任何被命名的類別。難點在於教會區域特徵(局部、物件層級)住進 CLIP 那個影像層級、文字對齊的空間——這透過從 CLIP 做知識蒸餾(ViLD)、在連結片語與框的定位資料上訓練(GLIP、MDETR、Grounding DINO),或混合偵測與大量影像描述資料(Detic、OWL-ViT)來解決。
OVD 是零樣本分類在偵測上的對應,也是語言驅動感知的關鍵推手:「找出這段影片裡每一個交通錐與嬰兒車」無需為每種新物件重新訓練偵測器即可運作。其評估方式是把類別分成基礎(已見)與新穎(未見),並回報在新穎集上的偵測準確率(如 AP),有時在 LVIS 長尾基準下進行。同一套機制也驅動開放詞彙分割,以及用來自動標註資料的文字提示式偵測流程。
留意評估協定:數字高度取決於哪些類別被算作「新穎」,以及這些新穎名稱是否出現在描述/定位的預訓練資料中。一個模型可能看起來「開放詞彙」,實則在預訓練時悄悄見過那些新穎詞,從而誇大了表面上的泛化能力。
又稱