JOVANA
Explore Library Glossary Getting Started Three Levels Fields How it works Mission
Join the mission
All guides

用圖像說話:生成與任意模態的前沿

讓模型輸出不只是文字——影像生成、任意模態互轉模型,以及對多模態走向的誠實檢視。

閉環:輸出,而不只是輸入

到目前為止,一切都是多模態、文字。前沿要把這個環閉合:模型也能產出非文字的模態。最受矚目的就是由大型語言模型生成影像(image generation from LLMs)——你描述一張圖,模型就畫出來;或你給它一張照片加一個要求(「改成日落、保留那隻狗」),它就編輯。那讓模型能影像的同一種語言理解力,正是讓它能操控影像創造的東西。

生成闭合了回路:模型在自回归循环中逐个 token 地产出输出。

自回归生成循环示意图:每个预测出的 token 被反馈作为下一个输入。

語言模型最後是怎麼畫出圖的

常見有兩種接法。第一種,語言模型擔任指揮:它詮釋你雜亂的要求、寫出一段精確的提示,再交給一個獨立的影像生成器(通常是擴散(diffusion)模型)。語言模型一個像素都沒畫——它指揮一位畫家。第二種更為統一的設計裡,模型發出它自己的特殊影像詞元,由一個解碼器把它們變回像素,於是生成一張圖,字面上就跟生成一個句子是同一個下一個詞元的迴圈——這正是多模態詞元化的直接回報。

在指挥者设计中,LLM 的提示词驱动一个独立的扩散模型,将纯噪声去噪成图像。

扩散过程逐步将随机噪声变成清晰图像。

任意互轉:一個模型,所有方向

把這個構想推到極限,你就得到任意模態模型(any-modality model):單一系統能接受任意組合的文字、影像、音訊與影片,也能輸出其中好幾種。對著一張照片用講的問問題、得到用講的回答;遞給它一張圖表、要求一個重新設計過的版本;餵進一段無聲影片、請它配旁白。由於每一種模態都只是共享串流裡的詞元,這個模型原則上能透過那個共通的「中介語」(interlingua),在任意一對感官之間互轉。

p(x_{1:T}) = \prod_{t=1}^{T} p\!\left(x_t \mid x_{<t}\right)

任意模态模型以自回归方式分解一条统一的 token 序列,无论每个 token 属于哪种模态。

這也是跨模態接地從「有更好」變成「核心」的地方:一個任意模態模型只有在它生成的音訊真的說出它讀到的影像所顯示的內容、它畫出的圖片真的符合給它的文字時,才值得信任。生成讓接地的失敗變得看得見、有時還很難堪——模型現在可以畫出它的幻覺,而不只是描述它。

走向何方——以及誠實的限制

軌跡很清楚:從純文字,到會讀圖的視覺語言模型,到聽覺與觀看,到跨模態生成,再到一個能流暢混用全部模態的任意模態系統。每一步都重用你在第二篇學到的同一套「編碼-投影-拼接」管線;前沿主要是把它用在更多感官、更高解析度、更長跨度、且更有效率上。

對缺口要保持務實。細緻的空間精度、可靠的計數、極小而密集的文字、在緊繃脈絡額度下的長影片推理,以及永不偏離提示的忠實生成——這些都還很難。多模態大型語言模型對「感知加推理」類任務確實有翻天覆地的作用,但它仍會自信地誤讀一張模糊的標籤。把它們當作一位有眼睛、有耳朵、聰明、快速、偶爾出錯的助理——並核對任何重要的事。

  1. 生成閉合了這個環:模型會輸出影像(以及更多),而不只是讀它們。
  2. 兩種接法:語言模型指揮一個獨立生成器,或統一的影像詞元輸出。
  3. 任意互轉是終點——每種模態都是單一共享串流裡的詞元。
  4. 一旦模型開始生成,接地會變得更難、也更明顯;重要的事務必核對。