多模態與視覺語言
視覺語言模型(VLM)
視覺語言模型是一套你可以「給它看一張圖、再跟它對話」的單一系統:它同時接收影像與文字作為輸入、產生文字作為輸出,於是你能要它描述照片、判讀圖表、回答關於示意圖的問題,或一步步推理它看到了什麼。其現代化身本質上是一個被裝上「眼睛」的大型語言模型——保留了流暢度與世界知識,同時獲得把文字接地到像素的能力。
主流配方是透過一個連接器,把預訓練好的視覺編碼器接到預訓練好的語言模型上:編碼器把影像轉成一格格的補丁特徵,投影模組或查詢模組把這些特徵映射進語言模型的詞元空間,語言模型則把它們當成提示裡多出來的詞元來處理。訓練分階段進行,先在說明文字資料上對齊連接器(骨幹凍結),再以視覺指令微調整套組合於以影像為基礎的對話上,使其能遵循任意使用者請求。
VLM 同時繼承了語言骨幹的長處與失敗模式:它會幻覺出畫面中根本不存在的物件、難以做到精確計數與空間關係判讀、並受限於編碼器看影像的解析度。要誠實地評估它們,必須探測其「接地」能力,而不是獎勵聽起來合理的文字。
物件幻覺是 VLM 的招牌失敗:語言先驗太強,模型會描述「這類場景通常有什麼」,而非「這張影像實際有什麼」。
又称
另见