多模態視覺語言

指涉表達分割

指涉表達分割(referring expression segmentation,RES)取一個自然語言片語與一張影像,產生該片語所描述之單一物件的像素級精確遮罩(mask)——例如給定「最靠近鏡頭的那塊披薩」,它輸出一個正好覆蓋那些像素的二值遮罩。它是視覺定位在分割層次上的近親:定位回傳粗略的邊界框,RES 則回傳精確的輪廓,這對影像編輯、機器人操作,以及任何在意像素邊界的任務都很重要。

RES 在兩方面比一般語意分割更難。第一,目標是由語言、而非固定類別選定的,因此模型必須理解屬性與關係,才能在外觀相似者之中挑出正確的實例(是某「一塊」,而非所有塊)。第二,它必須輸出精細遮罩,需要以文字為條件做逐像素的密集預測。因此架構會把語言特徵融入視覺解碼器——例如 LAVT 在階層式視覺 Transformer 的多個尺度注入文字,而 CLIPSeg 在凍結的 CLIP 之上加一個輕量解碼器,把文字(或影像)提示轉成遮罩。

RES 在 RefCOCO、RefCOCO+ 與 RefCOCOg 上評估,指標包括平均交並比(mean Intersection-over-Union,mIoU)——預測遮罩與真實遮罩的交集除以聯集——以及在各 IoU 門檻下的精確度。此任務自然地與可提示分割相連:Segment Anything Model(SAM)能從點或框提示產生高品質遮罩,因此一條常見的現代流程是先把片語定位成一個框(例如用 Grounding DINO),再把該框餵給 SAM,藉由組合產生文字驅動的分割(即「Grounded-SAM」)。

一張有三顆蘋果的影像,提示「被咬過的那顆蘋果」。RES 必須輸出一個只緊貼缺了一口的那顆蘋果的遮罩——靠屬性、而非類別來區分(三顆都是「蘋果」)。

又稱
RESreferring image segmentationlanguage-guided segmentation