多模態視覺語言

影像描述

影像描述(image captioning)是自動為一張影像寫出一句自然語言描述的任務,例如把一張照片轉成「一隻棕色的狗在公園裡接飛盤」這樣的描述。它是一個生成任務:不像分類是從固定的標籤清單中挑一個,描述必須產生自由格式、合乎文法的文字,且既要流暢(讀起來自然)又要忠實(確實符合影像內容)。

經典做法是編碼器—解碼器(encoder-decoder)。編碼器是一個視覺網路(最早用 CNN,如 ResNet;如今常用 ViT 或 CLIP 的影像編碼器),把影像壓縮成特徵向量。解碼器是一個語言模型(最早用 LSTM,現在用 Transformer),一次產生一個詞,每個預測出的詞會被回饋進去以預測下一個詞——這稱為自迴歸解碼(autoregressive decoding)。里程碑式的進展是加入視覺注意力(即「Show, Attend and Tell」的概念):產生每個詞時,解碼器會在影像區域上計算注意力權重,於是當它要寫「飛盤」時,會去看飛盤所在的 patch,而不是均勻地看整張圖。

影像描述在成對的影像—描述資料集上訓練,例如 MS COCO Captions(每張影像有五句人工描述),評估指標包括 BLEU 與 METEOR(與參考描述的 n-gram 重疊)、CIDEr(以 TF-IDF 加權的共識度,專為描述任務設計),以及 SPICE(比較類似場景圖的語意組)。無參考指標如 CLIPScore 則直接用 CLIP 衡量影像與描述的一致性,省去對人工參考句的需求。現代系統常常省略特定任務訓練,直接提示一個多模態大型語言模型去描述影像。

給定一張海灘照片,基於注意力的描述模型先輸出「一位」(注意力分布較廣),接著輸出「衝浪者」(注意力集中在站立的人影上),再輸出「正在乘浪」(注意力移到捲起的浪上)——每個詞都是在看著最相關的區域時生成的。

又稱
image description generation影像字幕生成