多模態大型語言模型

視覺語言模型(vision-language model)

視覺語言模型(vision-language model)是最常見的一種多模態大型語言模型:看得見的那種。給它一張照片問問題、給它一張圖解請它解說、把 app 截圖丟給它問為什麼某個按鈕變灰——它都用文字回答。它是電腦視覺(過去只會替圖片貼標籤)與語言(能描述、推理、對所見之物侃侃而談)之間的橋。

配方是一個強大的視覺編碼器——常是在海量圖文配對上訓練的視覺 Transformer,例如 CLIP 家族——透過投影器餵進一個預訓練語言模型。訓練分兩階段:先在數百萬組標題配對上把視覺特徵對齊到文字空間,再用指令資料微調,讓它聽從要求而不只是描述。一旦能讀懂影像,語言模型既有的知識就承擔了大部分粗重活。

它們的視力比看起來淺。抓大意、認得出名物很在行,但精確數數、確切的空間排列、雜亂場景裡的小字,以及任何需要像素級量測的事都很弱。把它們的視覺斷言當成有自信的猜測,而非量測結果。

又称
VLMvision-language model