多模態與視覺語言
多模態文件理解
多模態文件理解要求模型像人一樣讀一頁:同時納入文字、文字在頁面上的位置、以及周遭的視覺結構。一張表單、一張發票、一張科學插圖或一張財務圖表,只有在把文字與版面、表格、圖形一起詮釋時才說得通,因此這項任務是要對格式豐富的文件回答問題、抽取欄位、產生摘要,而非處理純粹的連續文字。
有兩個架構家族處理此事。版面感知編碼器(如 LayoutLM 系列)為文字 transformer 加上每個詞元邊界框的二維位置嵌入與一條融合的影像流,使「頁面上的位置」成為頭等訊號。較新、且日益主導的做法是端到端、以像素為基礎:視覺語言模型直接把文件當成高解析度影像讀取並解碼出答案,有時完全不靠外部光學字元辨識,這避開了 OCR 的錯誤傳播,卻要求編碼器解析細小密集的文字。圖表與表格問答更進一步,要求模型從渲染出的圖形中還原結構化數值。
持續存在的難題是解析度與推理。密集文件所含的可讀文字,遠多於標準視覺編碼器補丁網格所能解析者,逼得人們採用切塊或高解析度方案,而這會讓詞元數爆炸;圖表問題則要求對視覺化編碼的數字做量化推理,微小的判讀偏差會連鎖成錯誤答案。它是 VLM 應用中商業價值最高、卻仍不完美的一類。
又称
另见