生成模型理論

能量模型(EBM)

能量模型給每一個可能的組態指派一個純量能量,合理資料能量低、不合理資料能量高,並宣稱機率正比於負能量的指數。這是指定密度最靈活的方式,因為能量可以是任何你喜歡的函數、一個任意的神經網路,不受可逆性或可處理取樣等架構約束。代價是歸一化常數,也就是指數在所有組態上的積分,而它幾乎總是不可解。

最大似然訓練需要對數歸一化常數的梯度,它等於模型自己對能量梯度的期望,而這個期望無法以封閉形式計算。對比散度用短程馬可夫鏈蒙地卡羅(通常是沿能量梯度加雜訊的 Langevin 動力學)抽取負樣本來近似它,然後降低真實資料的能量、抬高這些合成負樣本的能量。分數匹配與雜訊對比估計則提供另外幾條少取樣、能擬合同一個未歸一化模型的途徑。

能量模型在概念上居於核心,因為擴散、分數匹配與許多經典模型其實都是偽裝過的未歸一化能量方法,但訓練的穩定性與緩慢的 MCMC 取樣,使純粹的能量模型不如其基於分數與基於流的親戚那般實用。

p_\theta(x)=\frac{e^{-E_\theta(x)}}{Z(\theta)},\qquad Z(\theta)=\int e^{-E_\theta(x)}\,\mathrm{d}x

把密度寫成玻茲曼分布;配分函數 Z 是每種訓練法都得設法繞過的不可解障礙。

能量只在相差一個加性常數的意義下被確定,所以能量模型從不承諾絕對機率,只承諾組態之間的相對機率。

又称
EBM能量基礎模型