多模態大型語言模型

影像描述(image captioning)

影像描述(image captioning)是最簡單的多模態任務:看一張圖,寫一句話描述它——一隻棕色的狗在夕陽海灘上接飛盤。這是孩子學著替世界命名的方式,也是研究者在視覺與語言之間搭起的第一座橋。對大型語言模型而言它幾乎是熱身,相當於把看到的東西唸出來。

影像描述正是把視覺編碼器對齊到語言模型的訓練訊號:餵進影像詞元,要模型一個詞一個詞地預測標題,梯度便教會投影器把視覺特徵映射到對的字上。現代系統不只給一句平淡的句子,而是給出密集、段落長度的描述,這些自動產生的標題又被回收成更大模型的訓練資料。

流暢的標題仍可能是錯的。模型仰賴先驗——海灘「應該」有夕陽——於是描述一個看似合理的場景,而非真正的場景,把與預期相牴觸的細節抹平。

又称
image captioningcaption generation