生成式AI與大型語言模型

潛在擴散(latent diffusion)

/ LAY-tunt dih-FYOO-zhun /

潛在擴散,是那個聰明的捷徑,它讓圖像生成器變得又快又省,省到能在尋常硬體上跑。普通擴散模型,是直接在「像素」上做它那套加噪去噪的活兒——而一張高解析度圖像有數以百萬計的像素,一步步去噪起來代價驚人。潛在擴散繞開了這一點:它不在原始像素上、而在圖像一個「壓縮、縮小過」的表示上,去完成整個去噪過程。

它分三步走。第一,一個獨立的網路(自編碼器)學會把一張圖像擠壓成一小段「潛在」代碼——一份緊湊的數字摘要,留住有意義的內容、扔掉像素層面的臃腫——並學會把這樣一段代碼再展開還原成一整張圖。接著,擴散完全在那個小小的潛在空間裡運行,它可能比原圖小上幾十倍,於是每一步去噪都快得多。最後,清理乾淨的潛在代碼再被解碼回一張全解析度的圖。廣為人知的Stable Diffusion家族,走的正是這條路。

誠實的取捨是:在壓縮空間裡幹活省下了海量算力,卻也扔掉了一些資訊,於是極精細的細節——人群中的小臉、招牌上的確切字母、繁複的紋理——可能出來時糊掉或出錯,因為那段潛在代碼從來就沒精確地攜帶過這些細節。這是一場了不起的效率勝利,讓圖像生成飛入尋常百姓家;但它不是免費的午餐,壓縮留下了看得見的指紋。

一張512×512的圖像約有26萬個像素。自編碼器把它壓縮成一張64×64的潛在網格——大約小了48倍。擴散的所有步驟都在那張小網格上跑,再由解碼器把結果放大回原尺寸。還是同一張圖,代價卻只是零頭。

在一個小小的壓縮空間裡去噪,再解碼回原尺寸。

潛在擴散,正是圖像生成便宜到能在消費級顯卡上跑的原因(Stable Diffusion,2022年)。代價在於那道壓縮:潛在代碼裝不下的精細細節——可讀的小字、人群中的臉——往往出來時就亂掉了,無論提示寫得多好。

又稱
latent diffusion modelLDM潜在扩散潛在擴散