視覺問答
視覺問答(visual question answering,VQA)是針對一張影像回答一個自由格式自然語言問題的任務,例如「有多少人戴帽子?」或「那把傘是什麼顏色?」。它位於視覺與語言的交會處:模型必須剖析問題、看影像中相關的部分,並結合兩者產生答案。與「凡是顯著就說」的影像描述不同,VQA 是有指向性的——問題明確告訴模型要查明什麼。
在機制上,VQA 需要多模態融合(multimodal fusion):影像表示與問題表示必須被結合起來,模型才能聯合推理。早期系統用 CNN 編碼影像、用 LSTM 編碼問題,再融合(串接或雙線性池化),然後在一個由高頻答案構成的固定詞彙上做分類。具影響力的「由下而上與由上而下注意力(bottom-up and top-down attention)」做法以物件偵測器的區域作為視覺單元,讓問題去對這些區域施加注意力。現代系統使用跨模態注意力 Transformer,或乾脆把影像餵給多模態大型語言模型,讓它以文字生成答案——這對開放式答案與多步推理的處理好得多。
VQA 以下列資料集為基準:VQAv2(刻意做平衡,使同一個問題在成對影像上有不同答案,以對抗走捷徑式的猜測)、GQA(由場景圖生成的組合式問題,測試關係推理)、OK-VQA(需要外部世界知識的問題)。一個核心陷阱是語言先驗(language priors):模型可能不真正看影像,只靠答案統計就得高分(「香蕉是什麼顏色?」→「黃色」),這正是平衡型與著重推理的基準存在的原因。
務必區分分類式 VQA(從約 3000 個高頻答案中挑選——這是較舊準確率數字的前提)與生成式 VQA(可寫出任意字串)。同一基準用這兩種方式評分並不能直接比較,且標準 VQA 準確率是對 10 個人工答案做軟性匹配,而非完全字串相等。