多模態大型語言模型

用大型語言模型做光學文字辨識(OCR with LLMs)

OCR(光學文字辨識)是指讀出影像裡的文字:拍下的招牌、掃描的合約、手寫便條、螢幕截圖。傳統 OCR 工具偵測字元、吐出一串字串。多模態大型語言模型把這個能力收進理解裡:它能讀菜單,還能告訴你哪道菜是素的;能把表格抄下來,並補上缺漏之處。

強大的多模態模型透過在海量帶字影像上訓練,隱性地學會 OCR,於是讀字變成視覺編碼器與投影器傳給語言模型的又一樣東西。因為模型懂語言,它能像人一樣用上下文修正模糊的字——從 inv0ice 猜出 invoice。這種讀與推理合一,正是傳統管線所缺的。

它並非無損。長文件、密集表格、罕見文字系統與低解析度都會造成無聲的錯誤——金額裡某個數字位置調換、漏掉一行——而模型很少標示自己的不確定,因此高風險的謄寫仍需查核。

又称
optical character recognitionOCR