JOVANA
Explore Library Glossary Getting Started Three Levels Fields How it works Mission
Join the mission
All guides

前沿:少步、蒸餾與離散生成

擴散唯一的弱點是它取樣步數太多。認識一致性模型、蒸餾與離散擴散——把生成推向單步、並跨出連續資料的研究前緣。

定義前沿的那個成本

擴散所有的好處,都來自把一次困難的跳躍攤提成許多容易的步驟——而這也正是它唯一真正的負擔。一個經典取樣器每張影像可能呼叫網路數百到數千次,使推論成本(inference cost)主宰了部署。DDIM整流流把步數砍掉數十倍;前沿則追問極限:我們能不能在單次網路評估內生成,又不交回品質?

扩散把一次困难的跳跃摊还成一条很长的去噪链——每生成一个样本都要多次调用网络,正是这一前沿要攻克的成本。

一排画面从纯噪声逐步去噪,最终变成清晰图像。

一致性模型:把整條軌跡塌縮成一個映射

一致性模型(consistency models)拿指南 4 的機率流 ODE,加上一個自我一致性條件:單一網路 *f(x_t, t)* 應把某條 ODE 軌跡上的任一點,直接映到該軌跡乾淨的端點 *x_0*。若此性質成立,在最高雜訊尺度評估 f 一次就是生成。訓練透過讓相鄰時間彼此一致來達成——可以蒸餾一個預訓練的擴散模型,也可以從頭獨立訓練。

f_\theta(\mathbf{x}_t, t) = f_\theta(\mathbf{x}_{t'}, t') \quad \forall\, t,t' \in [\epsilon, T], \qquad f_\theta(\mathbf{x}_\epsilon, \epsilon) = \mathbf{x}_\epsilon

自一致性性质:同一个网络把概率流轨迹上的每个点都映射到相同的起点,并由 ε 处的恒等边界条件锚定。

蒸餾:教快速的學生走慢老師的路

更廣的模式是蒸餾(distillation):先訓練一個多步的老師擴散模型,再把它的取樣軌跡壓縮進一個需要遠更少步數的學生。漸進式蒸餾反覆把步數減半;對抗式與分布匹配的變體則加上 GAN 風格或分數式的項,讓學生的輸出分布匹配老師的,而不只是個別軌跡。整流流的重流,是同一目標在傳輸幾何上的表親。

請保持適度的懷疑:少步樣本可能在平均指標上追平老師,卻丟失罕見模態、把紋理銳化成假影,或放大無分類器引導本已引入的多樣性損失。「單步生成」的標題很少回報尾端行為,而尾端正是蒸餾傷得最重的地方。

跨出連續資料:離散擴散

高斯雜訊與分數假設了連續的狀態空間,但文字、程式碼與分子活在離散的詞元(token)上。離散擴散模型(discrete diffusion models)把前向破壞重新定義為類別上的馬可夫過程——遮蔽詞元,或讓它們經由吸收態或均勻態轉移——再學著逆轉它。兩種主流是遮蔽/吸收態擴散(與遮蔽語言建模密切相關),以及由轉移率矩陣參數化的連續時間離散狀態鏈。

q(\mathbf{x}_t \mid \mathbf{x}_{t-1}) = \mathrm{Cat}\!\left(\mathbf{x}_t;\, \mathbf{p} = \mathbf{x}_{t-1}\mathbf{Q}_t\right)

离散扩散用类别转移矩阵 Q_t 取代高斯噪声,把词元逐步破坏到均匀分布或 [MASK] 状态。

既然自回歸語言模型已經那麼強,何必費這個事?離散擴散平行解碼,能在任一步修訂任一位置,而不是由左到右逐詞元定案——對填空、可控生成與延遲都很有前景。尚未解決的問題是:在規模化下,它能否補上與自回歸模型之間殘餘的概似與品質差距;這是活躍、未定論的研究。

离散扩散并行解码所有位置并可修改任意词元,不同于这种从左到右逐个生成的自回归循环。

自回归生成循环,从左到右一次生成一个词元。

理論仍然開放之處

綜觀整條軌道退一步看,未解的問題更清晰了。我們能漂亮地取樣,卻仍缺乏對「有限容量的分數網路在低密度區域究竟學到了多少真實分數」的緊緻、實用的界限。少步方法在我們完全理解「哪些機率路徑最容易拉直與蒸餾」之前,就已經實證上運作良好。而評估本身也搖晃——樣本品質指標與理論在意的密度涵蓋,相關性並不完美。

  1. 學到的分數的理論:在罕見區域的分數估計誤差,如何傳播成取樣偏差與模態遺失?
  2. 用於生成的最優傳輸:哪些機率路徑能最小化取樣步數,流匹配究竟能拉得多直?
  3. 離散與多模態的統一:一個有原則的框架,涵蓋連續、離散與混合資料,而不必硬加特例。
  4. 可信的評估:真正追蹤模態涵蓋與尾端保真度的指標,而非只看標題上的樣本銳利度。