多模態視覺語言

多模態大型語言模型

多模態大型語言模型(multimodal large language model,MLLM)是把大型語言模型加以擴充,使其除了文字之外還能接收影像(有時也包含音訊或影片),並對其推理與對話。直覺上,它是一個被賦予了眼睛的文字聊天機器人:你可以把一張圖片貼進對話,請它描述場景、回答問題、讀出圖中文字、解釋一張圖表、為一張截圖除錯,或從一份 UI 草圖寫出程式碼。GPT-4V、Gemini、Claude、Qwen-VL,以及開源的 LLaVA 系列等系統都是 MLLM。

主流架構是三部分模式:一個視覺編碼器(通常是 CLIP/SigLIP 式的 ViT)把影像轉成特徵向量;一個連接器把這些特徵轉譯到 LLM 的輸入空間;LLM 則進行推理與生成,把轉換後的影像當成接在文字之前的一串 token。連接器是主要的設計抉擇,有幾種樣式:簡單的線性或 MLP 投影器(LLaVA);透過 Q-Former(BLIP-2)或 Perceiver Resampler(Flamingo)以一小組可學習查詢 token 把眾多 patch 壓成少數 token;或在 LLM 中插入帶門控的跨注意力層(Flamingo),讓文字關注視覺而不拉長序列。

訓練通常有兩階段,沿襲自 LLaVA 的做法:在大量影像文字資料上的對齊/預訓練階段,主要教連接器把視覺特徵映射進語言空間;接著在對話式、以影像為基礎的資料上做視覺指令微調階段,產生有用的助理行為。由於 LLM 帶來廣泛的世界知識與推理能力,MLLM 的泛化表現出奇地好,但它們也繼承了 LLM 的弱點(幻覺、對提示敏感)加上視覺特有的弱點(精細空間精度差、計數弱、高解析度細節有限),這正是解析度處理、OCR 與接地成為積極改進領域的原因。

連接器的選擇是真正的取捨,而非表面工夫。投影器式(LLaVA)保留所有 patch token——細節與 OCR 強,但在高解析度下昂貴;resampler/Q-Former 式壓成固定的少數 token——便宜且序列長度穩定,但可能丟失精細細節。許多近期 MLLM 加入切塊(tiling)或動態解析度方案,正是為了找回被激進的 token 壓縮所丟失的細節。

又稱
MLLMLMMmultimodal LLM