多模態與視覺語言
圖文交錯建模
圖文交錯建模把文件當成它在真實世界裡實際呈現的樣子——影像與文字以任意順序交織,一段文字、接一張圖、接一段說明、再接更多文字,全部是同一條序列。它不採用早期資料集那種乾淨的「單圖加一句說明」格式,而是貼合網頁、手冊與文章;從中學習,能讓模型在脈絡中處理多張影像,並推理文字與圖片如何彼此來回指涉。
技術上,模型吞下單一條詞元流,其中由編碼器加重採樣器或投影模組產生的視覺詞元,被接插到它們原本在文字詞元之間的位置,並以自迴歸方式訓練——在「之前出現的一切(含影像)」的條件下預測下一個文字詞元。細緻的注意力遮罩把每段文字綁定到它之前的影像。在大型交錯語料上訓練,正是 Flamingo 及其後繼者解鎖少樣本多模態脈絡內學習的關鍵,因為這種格式天然提供了「圖-文-圖-文」的示範,模型可在推論時模仿。
交錯是真正多影像推理的底料——比較兩張圖表、跟著一份有插圖的步驟操作、為一連串畫面旁白——這些是單圖 VLM 做不到的。其代價是資料與長度:高品質的交錯語料比說明配對更難整理,而把許多影像塞進單一序列也會對脈絡視窗造成壓力。
又稱
另見