為何多模態評估暗藏陷阱
評估一個視覺語言模型比單獨評估視覺模型或語言模型都難,因為模型可能為了錯誤的理由而答對。許多基準題目單憑語言先驗、無視影像就能回答——「香蕉是什麼顏色?」——所以一個從不看圖的模型也能拿高分。真正的評估必須隔離視覺的貢獻,而非模型對世界冷知識的掌握。
- 探測語言先驗捷徑:在移除影像或換成噪音後重跑;分數依然很高,就是這個基準沒在測視覺的警訊。
- 對影像做反事實編輯(換掉物件、改變數量),檢查答案是跟著像素走、而非跟著先驗走。
- 稽核資料污染——許多網路規模語料早已包含熱門基準的影像及其答案。
重訪錨定與模態差距
視覺錨定是我們手上最誠實的探針,因為它逼模型對一個位置作出承諾。模型可以唬出一段看似合理的描述,但一個邊界框要嘛落在指涉物上、要嘛沒有——無處可躲。錨定準確率與模型是否真正運用其跨模態注意力、而非憑先驗敘述相關,這正是錨定基準日益成為感知黃金標準的原因。
第一篇的模態差距不只是趣聞——它形塑評估與能力。由於影像與文字嵌入住在分離的圓錐裡,在某一模態配對上調好的檢索閾值,遷移得很差,而粗暴的跨模態算術也會出狀況。研究者如今刻意研究縮小或利用這道差距;結論是:模型的幾何結構,而不只是它的準確率,才告訴你它將如何泛化。
两个向量及其夹角,点积等于两者长度之积乘以夹角余弦。
基準與模型評審
開放式的多模態答案難以用精確匹配評分,因此這個領域倚賴 LLM 當評審的模式——而且越來越是一個同時看得到影像的 VLM 評審。它的可擴展性極佳,卻承襲 LLM 評審的每一種偏誤:位置偏誤、長度偏誤與自我偏好。多模態評審還多了一個新失敗:它可能與受測模型共享同樣的視覺盲點,於是兩者同步漏掉同一個幻覺。
交并比(IoU)——即旁注中与评判模型搭配的客观接地指标:预测框 A 与真值框 B 的得分等于交集面积除以并集面积。
多模態幻覺
VLM 的招牌失敗是物件幻覺:自信地描述影像中沒有的東西——不存在的人、錯誤的顏色、圖表上虛構的標籤。其根源沿著這個系列一路追溯:強烈的語言先驗壓過微弱的視覺證據(第一篇的模態差距)、指令資料在未涵蓋的情況下教出自信的風格(第三篇)、以及影像解析度太低根本讀不到(第三篇的診斷)。此處的幻覺不是怪癖,而是各模態未能綁合的接縫。
緩解措施是疊加而非根治:對比解碼把「無影像」的預測相減以壓制先驗、錨定感知的微調獎勵先指出再宣稱、更高的輸入解析度、以及拒答訓練讓模型能說「從這張影像我判斷不出來」。每一招都削減其發生率;沒有一招能把它歸零。
把视觉对比解码写明:放大以图像为条件的对数几率,并减去无图像(仅文本)的预测 ℓ(y∣x),从而压制驱动物体幻觉的语言先验。
研究前沿
這個領域走向何方?走向任意對任意模型,讓理解與生成共享權重,於是生成影像能教模型感知得更好,反之亦然。走向原生高解析與長影片感知,而不讓 token 預算爆炸。走向在螢幕上行動而非只是描述的文件與圖形介面代理人。並走向有依據、忠實的推理,讓每個宣稱都繫於一個可見的區域。