多模態大型語言模型
視覺問答(visual question answering)
視覺問答(visual question answering,簡稱 VQA)是有目的的影像描述:不是自由描述,而是你問一個具體問題、想要一個具體答案。那位女士的傘是什麼顏色?桌邊有幾個人?紅綠燈是綠的嗎?模型得在影像中定位正確的東西,只回答那一點——比起含糊的標題,這是對「看見」更銳利的考驗。
機制上是同一條管線——影像詞元加上問題詞元進入 Transformer,由它生成答案——但問題會把注意力導向相關的區域。VQA 基準長期是多模態模型的標準量尺,涵蓋日常照片、圖表、文件與科學圖解,而指令微調把單純的 VQA 變成開放式的視覺對話。
VQA 把失敗模式攤得很清楚:數數、讀小字、否定句(如「哪個人沒有坐著」),以及那些誠實答案其實是「光看這張圖無從判斷」的問題,都能絆倒原本聽起來很權威的模型。
又称
另见