生成模型理論
基於分數的擴散(score-based diffusion)
想像把一張乾淨的圖片逐步攪入雜訊,直到變成純粹的雪花;基於分數的擴散就是學會把這部影片倒著播放。分數是雜訊資料對數密度的梯度,在每一個雜訊層級它都指向機率質量較密集的方向,也就是指向更合理的資料。只要處處知道這個方向,你就能從隨機雜訊出發,反覆把樣本往密度高處推,直到落在看起來像真實資料的地方。
形式上,一個固定的前向隨機過程把資料擾動成容易處理的先驗,通常是高斯分布。Song 等人用一條隨機微分方程統一了整個構造,而由 Anderson 一九八二年的定理,它的時間反轉只依賴每個時刻邊際分布的分數。我們訓練單一網路在所有雜訊尺度上逼近這個分數場,之後從先驗雜訊出發、對反向 SDE 或其機率流 ODE 積分即可取樣。關鍵事實是:即使雜訊邊際本身不可解,其分數仍可透過去雜訊分數匹配學到。
這個觀點統一了離散時間的去雜訊擴散、雜訊條件分數網路與連續時間表述,是現代影像、音訊與分子生成器的基礎。它把模型(一個分數場)與取樣器(任意 SDE 或 ODE 解器)解耦,使引導、少步快速取樣,以及透過變數變換公式做精確似然估計都成為可能。
\mathrm{d}x = \left[f(x,t)-g(t)^2\,\nabla_x\log p_t(x)\right]\mathrm{d}t + g(t)\,\mathrm{d}\bar{w}
反向時間 SDE:從雜訊積分回資料只需要分數,而分數由網路提供。
分數從不需要密度的歸一化常數,這正是擴散能建模那些精確似然法處理不了的高維資料的原因。
又称
另见