多模態視覺語言

視覺定位

視覺定位(visual grounding)是定位影像中某段語言所指涉的特定區域的任務。給定「左邊那個穿紅外套的男人」這個片語與一張擁擠的照片,模型必須回傳正好圈住那個男人的邊界框,而不是任何其他人。它把字詞「定位(ground)」到像素上——建立從語言指涉到具體位置的橋樑,這對任何需要對場景某部分精確地動作或談論的系統都至關重要。

有兩個密切相關的子任務。指涉表達理解(referring expression comprehension)取一整個表達,回傳它所指的單一區域(輸出:一個框)。片語定位(phrase grounding)取一句句子或描述,把其中每個名詞片語連到對應區域(輸出:多個片語—框成對)。兩者都需要模型用屬性(「紅」)、類別(「外套」)與空間關係(「在左邊」「在長椅旁」)來消歧——指涉表達在設計上就是能唯一挑出一個物件的最簡描述。

現代定位模型以跨模態注意力深度融合語言與視覺,並透過在偵測器提案中挑選、或直接回歸座標(DETR 式)來預測框。資料集包括 RefCOCO、RefCOCO+(不允許絕對位置詞,迫使依賴外觀)與 RefCOCOg(較長、較自然的表達),以及用於片語定位的 Flickr30K Entities。MDETR 與 GLIP 等模型藉由在片語—區域對齊上訓練而統一了偵測與定位,Grounding DINO 則把它帶向開放詞彙、文字提示式的偵測。定位也是能「指出自己所描述之物」的多模態 LLM 的構件(例如藉由輸出座標 token)。

又称
referring expression comprehensionphrase grounding視覺接地