多模態大型語言模型
視覺指令遵循(visual instruction following)
視覺指令遵循(visual instruction following)是把一個只會描述圖片的模型,變成會照你要求動手的模型的能力。裁出收據並把金額加總、用初學者聽得懂的話解釋這個電路、有沒有人沒戴安全帽——指令在文字裡、對象在影像裡,模型得結合兩者才能行動。這是讓聊天模型變得好用的指令微調的多模態版本。
在基礎的視覺—語言對齊之後,模型會在一批批影像、指令、好答案的三元組資料上微調——這些資料常是拿影像標題和定界框去提示一個強大的文字模型,再寫出問答配對而生成。這教會它去注意影像中相關的部位、聽從你要求裡的動詞、並把回覆排好版,而不是丟出一段千篇一律的標題。
指令資料形塑了行為,因此盲點也一併繼承:若微調集從沒要它數數或讀極小的標籤,它面對這類指令時會既有自信又出錯。
又称
另见