生成模型理論
證據下界(ELBO)
潛在變數模型說資料源於隱藏的成因,但要算資料的似然就得對每一個可能的隱藏成因求和,那通常是個不可解的積分。證據下界是一個可計算的量,永遠落在這個真正對數似然之下,於是最大化下界會把似然往上推,同時保持可處理。它是變分自編碼器、乃至於現代許多機率生成建模背後的引擎。
這個界的導法是引入一個對潛在變數的近似後驗並套用 Jensen 不等式,或等價地注意到對數似然等於 ELBO 加上「從近似後驗到真後驗的 Kullback-Leibler 散度」。由於該散度非負,ELBO 就是證據的下界,而當近似後驗等於真後驗時間隙恰好閉合。這個界乾淨地分解成一個重建項(潛在變數解釋資料的好壞)減去一個把近似後驗拉向先驗的正則項,這正是用重參數化技巧端到端訓練的形式。
最大化 ELBO 身兼兩職:既擬合生成模型,又同時訓練推論網路,但由於這個界鬆掉的量恰好是後驗間隙,一個模型可能 ELBO 分數很好、後驗卻不準,這也是更緊的界之所以被提出的動機。
\log p(x)\ \ge\ \mathbb{E}_{q(z\mid x)}\big[\log p(x\mid z)\big]-\mathrm{KL}\big(q(z\mid x)\,\|\,p(z)\big)
重建減去一個匹配先驗的懲罰;鬆弛量等於後驗近似的 KL。
ELBO 的間隙恰好是從近似後驗到真後驗的 KL,所以高 ELBO 只在推論網路準確的範圍內,才保證模型好。
又稱
另見