定義前沿的那個成本
擴散所有的好處,都來自把一次困難的跳躍攤提成許多容易的步驟——而這也正是它唯一真正的負擔。一個經典取樣器每張影像可能呼叫網路數百到數千次,使推論成本(inference cost)主宰了部署。DDIM 與整流流把步數砍掉數十倍;前沿則追問極限:我們能不能在單次網路評估內生成,又不交回品質?
一排画面从纯噪声逐步去噪,最终变成清晰图像。
一致性模型:把整條軌跡塌縮成一個映射
一致性模型(consistency models)拿指南 4 的機率流 ODE,加上一個自我一致性條件:單一網路 *f(x_t, t)* 應把某條 ODE 軌跡上的任一點,直接映到該軌跡乾淨的端點 *x_0*。若此性質成立,在最高雜訊尺度評估 f 一次就是生成。訓練透過讓相鄰時間彼此一致來達成——可以蒸餾一個預訓練的擴散模型,也可以從頭獨立訓練。
自一致性性质:同一个网络把概率流轨迹上的每个点都映射到相同的起点,并由 ε 处的恒等边界条件锚定。
蒸餾:教快速的學生走慢老師的路
更廣的模式是蒸餾(distillation):先訓練一個多步的老師擴散模型,再把它的取樣軌跡壓縮進一個需要遠更少步數的學生。漸進式蒸餾反覆把步數減半;對抗式與分布匹配的變體則加上 GAN 風格或分數式的項,讓學生的輸出分布匹配老師的,而不只是個別軌跡。整流流的重流,是同一目標在傳輸幾何上的表親。
請保持適度的懷疑:少步樣本可能在平均指標上追平老師,卻丟失罕見模態、把紋理銳化成假影,或放大無分類器引導本已引入的多樣性損失。「單步生成」的標題很少回報尾端行為,而尾端正是蒸餾傷得最重的地方。
跨出連續資料:離散擴散
高斯雜訊與分數假設了連續的狀態空間,但文字、程式碼與分子活在離散的詞元(token)上。離散擴散模型(discrete diffusion models)把前向破壞重新定義為類別上的馬可夫過程——遮蔽詞元,或讓它們經由吸收態或均勻態轉移——再學著逆轉它。兩種主流是遮蔽/吸收態擴散(與遮蔽語言建模密切相關),以及由轉移率矩陣參數化的連續時間離散狀態鏈。
离散扩散用类别转移矩阵 Q_t 取代高斯噪声,把词元逐步破坏到均匀分布或 [MASK] 状态。
既然自回歸語言模型已經那麼強,何必費這個事?離散擴散平行解碼,能在任一步修訂任一位置,而不是由左到右逐詞元定案——對填空、可控生成與延遲都很有前景。尚未解決的問題是:在規模化下,它能否補上與自回歸模型之間殘餘的概似與品質差距;這是活躍、未定論的研究。
自回归生成循环,从左到右一次生成一个词元。
理論仍然開放之處
綜觀整條軌道退一步看,未解的問題更清晰了。我們能漂亮地取樣,卻仍缺乏對「有限容量的分數網路在低密度區域究竟學到了多少真實分數」的緊緻、實用的界限。少步方法在我們完全理解「哪些機率路徑最容易拉直與蒸餾」之前,就已經實證上運作良好。而評估本身也搖晃——樣本品質指標與理論在意的密度涵蓋,相關性並不完美。
- 學到的分數的理論:在罕見區域的分數估計誤差,如何傳播成取樣偏差與模態遺失?
- 用於生成的最優傳輸:哪些機率路徑能最小化取樣步數,流匹配究竟能拉得多直?
- 離散與多模態的統一:一個有原則的框架,涵蓋連續、離散與混合資料,而不必硬加特例。
- 可信的評估:真正追蹤模態涵蓋與尾端保真度的指標,而非只看標題上的樣本銳利度。