生成式視覺:擴散與文生圖

DALL-E

DALL-E 是 OpenAI 的一系列文生圖系統,追溯它的三個世代,等於是一趟濃縮的領域演進之旅——從自迴歸 Transformer 到擴散。最初的 DALL-E(2021 年初)是一個里程碑式的展示:單一個模型能從自由格式的字幕生成連貫影像,並以真正新穎的方式組合概念(「一張酪梨形狀的扶手椅」),證明了文生圖是一項可行、通用的能力,而非一個狹隘的把戲。

技術上,各世代差異懸殊。DALL-E 1 是自迴歸的:一個離散 VAE(dVAE)把影像壓縮成一格網格的碼 token,一個大型 Transformer 則以文字 token 為條件、一個接一個地生成那些影像 token——本質上是「對影像區塊做語言建模」。DALL-E 2(2022)改用擴散與 unCLIP 架構:一個「先驗」(prior)模型把文字映射成一個 CLIP 影像嵌入,接著一個擴散「解碼器」從那個嵌入生成影像,再以超解析度擴散階段把結果放大。DALL-E 3(2023)聚焦於提示保真度,其值得注意之處在於:它是在經過豐富改寫、高度描述性的合成字幕上訓練的,並與一個大型語言模型(GPT)整合,後者在生成前把使用者的簡短提示擴寫成詳細提示——大幅改善了複雜提示被遵循的忠實程度。

DALL-E 既作為一條研究脈絡、也作為一個參照點而重要。它讓「自迴歸影像 token」的做法普及(後來被其他系統呼應),接著協助確立擴散為主導範式,而 DALL-E 3 的字幕改寫策略,把「遵循提示」重新框定為部分是資料與語言模型的問題,而非純粹是生成器架構的問題。與 Stable Diffusion 不同,DALL-E 的權重是封閉的、透過 API 存取,因此它站在定義現代格局之「開放/封閉」分野的專有那一側。

當有人說「DALL-E 會做某事」時,要問是哪個版本:各架構在根本上不同(自迴歸對擴散),因此關於它如何運作、它的失敗模式或它的速度之主張,都是因版本而異的。DALL-E 2 的 unCLIP 解碼器與 DALL-E 3 由大型語言模型驅動的字幕改寫,特別容易被混為一談,但其實是完全分開的兩個概念。

又稱
DALL·EDALL-E 1/2/3unCLIP