多模態視覺語言

LLaVA 模型

LLaVA(Large Language and Vision Assistant,大型語言與視覺助理)於 2023 年提出,是一套讓既有對話 LLM 獲得「看」的能力的簡單而具影響力的做法。其設計刻意極簡:取一個預訓練的 CLIP 視覺編碼器(ViT-L/14)把影像轉成視覺特徵,取一個預訓練的指令微調 LLM(最初是 Vicuna),再用一個小型投影模組把視覺特徵映射進 LLM 的 token 嵌入空間來連接兩者。投影後的影像特徵成為「視覺 token」,與文字 token 一起坐在提示中,LLM 把它們當成可關注的任何其他輸入。

在原始 LLaVA 中,連接器是單一線性層;LLaVA-1.5 把它升級為一個小型雙層 MLP,並加入更高解析度的輸入與學術 VQA 資料,以極小的額外成本換來大幅提升。整個重點在於參數效率與簡潔:大部分能力早已存在於凍結或輕度微調的 CLIP 編碼器與 LLM 之中,只有輕量的投影器(以及選擇性地 LLM)需要訓練來對齊兩者。

訓練分兩階段進行。第一,特徵對齊預訓練:在影像—描述對上,只訓練投影器,使視覺 token 落在 LLM 能解讀的嵌入空間區域。第二,視覺指令微調(visual instruction tuning):在對話式、以影像為基礎的指令資料上微調——著名做法是用影像標註去提示(純文字的)GPT-4 來產生多樣的問答對話——這教會模型遵循視覺指令並就影像對話。LLaVA 證明了這種輕量做法能造就一個有能力的開源多模態助理,並成為多模態 LLM 事實上的開源基準。

一個 CLIP ViT-L/14 把 336×336 的影像轉成約 576 個 patch 特徵;LLaVA 的 MLP 投影器把每個映射成一個 LLM 尺寸的嵌入,產生約 576 個「視覺 token」接在使用者文字問題之前——之後一次標準的 LLM 前向傳遞就產生對話回覆。

又稱
Large Language and Vision Assistant