多模態大型語言模型
跨模態接地(cross-modal grounding)
接地(grounding)是把一個詞綁到它在另一模態裡所指的確切事物上的動作——其實就是指出來。當你說左邊那隻狗,跨模態接地(cross-modal grounding)就是模型知道這個詞組挑出的是哪一塊像素;在影片裡是哪個時刻,在音訊裡是哪位說話者。它把含糊的描述,變成語言與模型所感知世界之間的精確連結。
具體而言,一個有接地能力的模型能在文字旁輸出定界框、分割遮罩或時間戳,於是那扇破掉的窗附帶座標。它從把詞組配上區域或時間段的資料中學會這件事,訓練文字詞元與影像或音訊詞元之間的注意力對齊。跨模態注意力是底層機制——文字查詢去注意視覺鍵,便揭示每個詞倚靠的是哪個區域。
接地正是區分能就一張圖說得頭頭是道與能讓你信任它據此行動(按對按鈕、標出對的瑕疵)兩種模型的分水嶺;但對小物件、擁擠場景,以及無法對應到單一區域的抽象詞組,它仍很脆弱。
又称
另见