多模態大型語言模型

圖表與文件理解(chart and document understanding)

這是讀懂結構化視覺資訊的能力——長條圖、試算表、發票、多頁 PDF、科學圖——並回答問題或抽出資料。哪一季營收最高?把每一個品項和價格都抽出來。這正是多模態大型語言模型在工作上真正派上用場之處:把一張報表截圖,變成你能用白話查詢的東西。

它一次結合好幾種能力:用 OCR 讀出數字與標籤、用版面理解判斷某個值屬於哪個格子或哪條軸、再用推理去比較、加總或看趨勢。模型在大量圖表與文件配上問答資料的集合上訓練,有時還附上底層表格,讓模型學會還原結構而不只是像素。這裡的解析度比自然照片更要緊,因為資訊本身就是那些小字。

對讀到的東西做算術是弱項——模型可能正確解析了表格,卻把總和算錯——因此把它配上計算機或程式工具,而非信任它的心算,才是可靠的作法。

又称
document AIchart question answering