多模態視覺語言

視覺提示

視覺提示(visual prompting)是指用放在影像中或影像旁的線索來引導模型,而不只用文字。就像你能藉由措辭來提示語言模型,你也能藉由「指」來提示視覺模型:點一個點、畫一個框、塗鴉,或標記區域,告訴模型該聚焦何處、要對什麼操作。最清楚的例子是 Segment Anything Model(SAM),它是可提示的——你給它一個點或一個框,它就回傳該處物件的遮罩——把互動式選取變成一等的輸入。

這個詞涵蓋兩個相當不同的概念。第一是推論時的空間提示:疊加模型本就理解的視覺線索(點、框、圈,或編號標記)。一個引人注目的發現是,在物件周圍畫一個紅圈可讓 CLIP 去關注它;而「標記集(Set-of-Mark)」提示——在影像上疊加帶編號的分割遮罩,並以編號指涉物件——能顯著改善 GPT-4V 等多模態 LLM 的視覺定位。這些線索不需訓練;它們利用了模型本就對顯著標記的敏感度。

第二個概念是參數層級的視覺提示微調(visual prompt tuning,VPT):與其為新任務微調整個視覺 Transformer,你把它凍結,並在前面加上少量可學習的「提示」token(或學習一個影像空間的擾動),在該任務上加以最佳化。這是 NLP 中提示微調在視覺上的對應——一種參數高效的適配方法,只調整一小組輸入,而讓龐大的骨幹保持不動。這兩種意義都共享提示的精神:改變輸入、而非權重,來控制行為。

標記集(Set-of-Mark):用 SAM 分割一張廚房照片,在遮罩上疊加編號 1 到 9,再問 MLLM「哪個編號的物件能燒開水?」模型回答「7(水壺)」——用標記來指涉,繞過了它薄弱的座標接地能力。

又称
visual promptsvisual prompt tuning (VPT)