生成式AI与大语言模型

潜在扩散(latent diffusion)

/ LAY-tunt dih-FYOO-zhun /

潜在扩散,是那个聪明的捷径,它让图像生成器变得又快又省,省到能在寻常硬件上跑。普通扩散模型,是直接在「像素」上做它那套加噪去噪的活儿——而一张高分辨率图像有数以百万计的像素,一步步去噪起来代价惊人。潜在扩散绕开了这一点:它不在原始像素上、而在图像一个「压缩、缩小过」的表示上,去完成整个去噪过程。

它分三步走。第一,一个独立的网络(自编码器)学会把一张图像挤压成一小段「潜在」代码——一份紧凑的数字摘要,留住有意义的内容、扔掉像素层面的臃肿——并学会把这样一段代码再展开还原成一整张图。接着,扩散完全在那个小小的潜在空间里运行,它可能比原图小上几十倍,于是每一步去噪都快得多。最后,清理干净的潜在代码再被解码回一张全分辨率的图。广为人知的Stable Diffusion家族,走的正是这条路。

诚实的取舍是:在压缩空间里干活省下了海量算力,却也扔掉了一些信息,于是极精细的细节——人群中的小脸、招牌上的确切字母、繁复的纹理——可能出来时糊掉或出错,因为那段潜在代码从来就没精确地携带过这些细节。这是一场了不起的效率胜利,让图像生成飞入寻常百姓家;但它不是免费的午餐,压缩留下了看得见的指纹。

一张512×512的图像约有26万个像素。自编码器把它压缩成一张64×64的潜在网格——大约小了48倍。扩散的所有步骤都在那张小网格上跑,再由解码器把结果放大回原尺寸。还是同一张图,代价却只是零头。

在一个小小的压缩空间里去噪,再解码回原尺寸。

潜在扩散,正是图像生成便宜到能在消费级显卡上跑的原因(Stable Diffusion,2022年)。代价在于那道压缩:潜在代码装不下的精细细节——可读的小字、人群中的脸——往往出来时就乱掉了,无论提示写得多好。

又称
latent diffusion modelLDM潜在扩散潛在擴散