多模態與視覺語言

任意對任意多模態模型

任意對任意多模態模型的目標,是把一群各司其職的專用系統——一個做看圖說話、一個做文生圖、一個做語音——收攏成單一網路,既能理解、也能生成,橫跨文字、影像、音訊、有時還有影片。你可以餵給它任意模態的組合、要它回傳任意模態的組合,於是同一個模型也許在一段對話裡讀一張照片、用語音回答、再畫一幅插圖,全部用同一套權重。

主流策略是把每個模態都詞元化成一條共享的離散或連續序列,再訓練一個 transformer 以自迴歸或擴散方式對這條聯合序列建模。影像與音訊透過 VQ 碼本等可學習的詞元化器映射成詞元,於是生成一張圖就變成與生成一句話相同的「預測下一個詞元」問題;或者,由語言模型輸出潛在條件,再由擴散解碼器渲染成像素或波形。無論哪種,統一的賭注都是:對單一交錯序列的單一目標,能學到分開的模型只能零碎學到的跨模態結構。

其魅力在於真正的遷移與湧現的跨模態能力,但工程上極為艱難:各模態的序列長度與資訊密度天差地遠,統一模型的生成品質仍落後於專用生成器,而調配訓練比例使視覺不致淹沒語音也是個未解問題。這類模型進展飛快,卻仍比單一用途的表親更難推到頂尖水準。

又稱
any-to-anyunified multimodal任意對任意多模態omni model