多模態視覺語言

視覺指令微調

視覺指令微調(visual instruction tuning)是把一個原始的「影像加語言」模型,轉變成一個會遵循關於影像之指令的有用對話助理的微調步驟。可類比於純文字指令微調,後者教會基礎 LLM 回答問題、遵循命令,而不只是續寫文字。視覺指令微調對多模態模型做同樣的事:用(影像、指令、期望回應)形式的範例訓練它們,使它們學會描述、回答、推理、比較與就影像對話,而非只是吐出一句平淡的描述。

瓶頸在於資料:高品質、以影像為基礎的對話很稀缺。LLaVA 的洞見是借助一個強大的純文字 LLM 來廉價地生成它們。取一張本就有豐富標註的影像(來自 COCO 等資料集的描述、物件框、區域描述),把這些文字標註餵給 GPT-4,並提示它彷彿正在看那張影像般,編造出多樣的對話——詳細描述、多輪問答與複雜推理。成果是一個大型的合成指令遵循資料集,再用來微調多模態模型。後續工作加入了人工標註與學術任務資料、GPT-4V 生成的資料,以及更難的推理與大量 OCR 的範例。

為何重要:指令微調是讓多模態模型可用的關鍵。一個只做過對齊(CLIP 式)或只在描述上預訓練的模型能匹配或描述,但它不會自然地回答「這為什麼好笑?」「把表格擷取成 JSON」,或進行多輪對話。視覺指令微調也是塑造格式遵循、拒答與接地等行為之處——更是資料品質直接控制幻覺之處,因為教模型只陳述看得見的內容,能減少自信卻錯誤的描述。

合成指令資料是雙面刃:若教師模型寫出貌似合理卻未經驗證的細節,學生就會學著自信地把它們幻覺出來。優良的流程會把生成錨定在真實標註上並過濾忠實度;POPE 等基準專門探測指令微調期間引入的物件存在性幻覺。

又称
multimodal instruction tuning