生成模型理論

去雜訊擴散機率模型(DDPM)

DDPM 把生成視為還原一個固定的破壞過程。前向鏈把一個乾淨資料拿來,分許多步、每步加入少量高斯雜訊,直到足夠多步之後資料已與標準雜訊難以區分。生成則反其道而行:模型從雜訊出發,一步步預測並移除少量雜訊,逐漸從隨機中雕出結構。每個反向步驟都是一個微小的去雜訊問題,遠比一次生出整張圖片容易學。

前向過程是一條具固定變異排程的高斯馬可夫鏈,一個方便的性質是:給定乾淨資料時,任一步的雜訊樣本都有封閉形式的高斯分布,因此訓練完全不必模擬整條鏈。Ho 等人證明,在一個重參數化下,資料似然的變分界會化簡成真正注入的雜訊與網路對它的預測之間的單純均方誤差。取樣時則套用學到的反向轉移,它們是高斯分布,其平均由雜訊預測決定。

DDPM 在數學上等價於離散時間的基於分數的擴散:預測注入的雜訊,在差一個縮放因子的意義下,就是預測雜訊邊際的分數。正是這個等價性,讓同一個訓練好的模型可以用較慢的隨機鏈、確定性的隱式取樣器,或 ODE 解器來取樣。

\mathcal{L}_{\mathrm{simple}}=\mathbb{E}_{t,x_0,\epsilon}\big\|\,\epsilon-\epsilon_\theta(\sqrt{\bar\alpha_t}\,x_0+\sqrt{1-\bar\alpha_t}\,\epsilon,\,t)\,\big\|^2

訓練網路預測隨機某一步加入的雜訊;取樣時每次去雜訊一步來反轉整條鏈。

著名的簡化目標捨棄了變分界的重新加權;該加權對似然有影響,但未加權的雜訊預測損失給出最好的樣本。

又称
DDPM去雜訊擴散機率模型