多模態與視覺語言

視覺指令微調

視覺指令微調這一步,把一個僅僅完成對齊的視覺語言模型,變成能像聊天助理遵循文字指令那樣、遵循關於影像的指令。做法是組出一份以影像為基礎的對話資料集——一張圖、加上使用者請求、加上期望答案——再微調模型去產生答案,於是之後它便能依命令看圖說話、回答開放問題、推理場景、並以指定風格交談。

讓這件事變得可行的關鍵手法由 LLaVA 提出:用純文字語言模型廉價地生成對話——把一張影像的說明文字、物件框與其他符號化描述餵給它,要它「假裝看得見」地寫出豐富的問與答。這個自舉過程能大規模產出詳細描述、推理、多輪對話等範例,再與重新格式化成指令形式的學術視覺語言資料集混合。微調通常更新投影模組與語言模型,而視覺編碼器多半凍結。

由於這份合成監督是由一個從未真正看過像素的語言模型撰寫,視覺指令微調可能教會模型「聽起來自信卻未接地」的行為——若原始說明文字單薄,便會放大幻覺。平衡資料配比、加入負例或聚焦接地的範例,與擴大規模一樣重要。

由「看不見」的語言模型撰寫的指令資料,是許多 VLM 的原罪:模型學到了接地答案的「文體」,卻沒學到其「實質」。

又称
視覺指令微調LLaVA-style tuning