生成模型理論
分數匹配(score matching)
假設你想建模一個機率密度,但歸一化常數,也就是讓它積分為一的那個積分,根本算不出來。分數匹配完全繞過這個問題。它不去匹配密度本身,而是匹配密度的形狀,具體來說是對數密度的梯度,業界稱之為分數。由於對數的梯度會消掉任何常數因子,那個棘手的歸一化常數直接消失,於是你完全不必計算它就能擬合模型。
Hyvärinen 二〇〇五年的目標函數最小化模型分數與未知資料分數之間的期望平方距離。資料分數雖不可得,但分部積分能把損失轉成可處理的形式,只牽涉模型分數的散度加上其平方範數的一半,全部只用到模型及其自身的導數。計算散度(一個 Hessian 跡)在高維下代價昂貴,因此實務以可擴展的變體為主:切片分數匹配用隨機投影估計這個跡,去雜訊分數匹配則把資料替換成與高斯雜訊卷積後的資料,其目標分數有封閉形式。
去雜訊分數匹配是擴散模型的主力,因為各層級雜訊資料的分數正是反向過程所需要的。同樣的免歸一化常數特性也讓分數匹配成為能量模型的自然訓練原則,否則配分函數會是那裡的核心障礙。
J(\theta)=\tfrac{1}{2}\,\mathbb{E}_{p_{\mathrm{data}}}\big\|\,s_\theta(x)-\nabla_x\log p_{\mathrm{data}}(x)\,\big\|^2
理想的分數匹配損失;分部積分移除未知的資料分數,留下可計算的替代式。
去雜訊分數匹配學的是平滑後密度的分數,而非乾淨密度的分數,所以雜訊大小是一個刻意引入的偏差,用來與估計變異做取捨。
又称
另见