電腦視覺

擴散式圖像生成(image generation via diffusion)

/ dih-FYOO-zhun IM-ij jen-er-AY-shun /

擴散是當今大多數圖像生成器背後的技術。它的思路近乎悖論:要教一個模型創造圖像,先教它毀掉圖像。在訓練中,你拿來真實照片,一步步地往上加隨機噪聲,直到每張都變成純粹的雪花點,而模型則學著逆轉其中一步——把一張稍帶噪聲的圖變得稍微乾淨一點。要生成新東西時,你從一整片純噪聲出發,把這套學來的「清理」反覆運行幾十次,直到一幅連貫的圖像浮現出來,彷彿一張照片正從雪花中顯影。

讓它變得可控的,是用一段文字提示來引導這場清理。一個獨立的文字理解模型把「一隻繫著紅圍巾的狐狸」翻譯成引導信號,在每一步去噪時,都把圖像往「貼合這些詞」的方向輕推。大多數實用系統是在一個壓縮過的「潛在」空間裡幹這件事,而不是在原始像素上,這正是它快到能在消費級硬體上運行的原因。其成果,就是2022年前後名聲大噪的那種照片級與繪畫感的圖像生成。

誠實地框定它很重要,因為吹捧的聲音很大。擴散模型並不理解一個場景;它學到的是數百萬張訓練圖像的統計規律,並產出它所見過之物的、貌似合理的新排列。所以它既可以驚人地有創意,也可以自信地犯錯——扭曲的手和文字、違背物理的畫面、從未存在過的臉。它會回放訓練數據裡的偏見與風格,由於這些數據往往未經許可便被抓取,這就引出了關於版權與同意的真實問題。而它讓「偽造」變得輕而易舉,這正是深度偽造背後的引擎。漂亮的輸出,和真實的輸出,並不是一回事。

輸入「一名太空人在月球上騎馬,照片級真實」。模型從隨機的雪花點出發,經過大約30個去噪步驟、每一步都被你的文字輕推,最終解析出一張以假亂真的圖像。但湊近看,那匹馬可能有五條腿,太空人的手套可能糊進了韁繩裡——一眼看去合情合理,細究之下卻破綻百出。

在文字引導下,經由許多小步從噪聲走向圖像——乍看令人信服,細節處卻常有破綻。

擴散模型重組的是它訓練圖像裡的統計規律;它既不去「查」什麼,也不理解場景。這正是為什麼它會憑空造出從未存在的人、把手和文字畫砸,還可能複製受版權保護的風格——也正是為什麼「照片級真實」絕不該被讀作「真實」或「屬實」。

又稱
diffusion image synthesistext-to-image diffusion扩散生成擴散生成diffusion models for images