扩散式图像生成(image generation via diffusion)
/ dih-FYOO-zhun IM-ij jen-er-AY-shun /
扩散是当今大多数图像生成器背后的技术。它的思路近乎悖论:要教一个模型创造图像,先教它毁掉图像。在训练中,你拿来真实照片,一步步地往上加随机噪声,直到每张都变成纯粹的雪花点,而模型则学着逆转其中一步——把一张稍带噪声的图变得稍微干净一点。要生成新东西时,你从一整片纯噪声出发,把这套学来的「清理」反复运行几十次,直到一幅连贯的图像浮现出来,仿佛一张照片正从雪花中显影。
让它变得可控的,是用一段文字提示来引导这场清理。一个独立的文字理解模型把「一只系着红围巾的狐狸」翻译成引导信号,在每一步去噪时,都把图像往「贴合这些词」的方向轻推。大多数实用系统是在一个压缩过的「潜在」空间里干这件事,而不是在原始像素上,这正是它快到能在消费级硬件上运行的原因。其成果,就是2022年前后名声大噪的那种照片级与绘画感的图像生成。
诚实地框定它很重要,因为吹捧的声音很大。扩散模型并不理解一个场景;它学到的是数百万张训练图像的统计规律,并产出它所见过之物的、貌似合理的新排列。所以它既可以惊人地有创意,也可以自信地犯错——扭曲的手和文字、违背物理的画面、从未存在过的脸。它会回放训练数据里的偏见与风格,由于这些数据往往未经许可便被抓取,这就引出了关于版权与同意的真实问题。而它让「伪造」变得轻而易举,这正是深度伪造背后的引擎。漂亮的输出,和真实的输出,并不是一回事。
输入「一名宇航员在月球上骑马,照片级真实」。模型从随机的雪花点出发,经过大约30个去噪步骤、每一步都被你的文字轻推,最终解析出一张以假乱真的图像。但凑近看,那匹马可能有五条腿,宇航员的手套可能糊进了缰绳里——一眼看去合情合理,细究之下却破绽百出。
在文字引导下,经由许多小步从噪声走向图像——乍看令人信服,细节处却常有破绽。
扩散模型重组的是它训练图像里的统计规律;它既不去「查」什么,也不理解场景。这正是为什么它会凭空造出从未存在的人、把手和文字画砸,还可能复制受版权保护的风格——也正是为什么「照片级真实」绝不该被读作「真实」或「属实」。