生成模型理論

隨機微分方程生成建模(SDE-based generative modeling)

這是把擴散模型納為特例的連續時間主框架。想像資料被緩緩溶解成雜訊,不是分離散的步驟,而是由一條隨機微分方程描述的連續流動,其中一個確定性的漂移把樣本往某方向拉,一個隨機的擴散項則讓它們抖動。生成就是這場溶解的時間反轉:從雜訊出發,往回積分一條學到的反向時間 SDE,直到結構重新浮現。

前向 SDE 的漂移與擴散係數被選成讓資料平滑變成一個可處理的終端分布;常見選擇是變異爆炸與變異保持兩種 SDE,分別對應分數匹配網路與 DDPM。Anderson 的反向時間定理指出,反轉本身也是一條 SDE,其漂移多了一項正比於時間邊際分數的項,因此一個用去雜訊分數匹配、在所有雜訊層級上訓練的網路,就能提供反向動力學所需的一切。同一個訓練好的分數既給出隨機的反向 SDE,也給出其確定性的機率流 ODE。

把生成詮釋為前向加雜訊與學到的反向時間 SDE,統一了原本各自分立的方法,攤開了雜訊排程與取樣器的設計空間,並把生成建模連到隨機與常微分方程那套豐富的數值工具箱。

\text{forward: }\ \mathrm{d}x=f(x,t)\,\mathrm{d}t+g(t)\,\mathrm{d}w;\quad \text{reverse: }\ \mathrm{d}x=\big[f-g^2\nabla_x\log p_t\big]\mathrm{d}t+g\,\mathrm{d}\bar w

前向加雜訊 SDE 與其 Anderson 反轉;分數是唯一需要學習的成分。

變異爆炸與變異保持 SDE 不是不同的模型,而是同一個基於分數家族的不同參數化,因此在其中一種下訓練的網路可被改寫成另一種。

又稱
score SDESDE-based generative model隨機微分方程生成模型