貝氏深度學習
攤銷變分推論(amortized variational inference)
古典變分推論為每一筆資料各自擬合一組變分參數,等於每個範例都解一個小型最佳化問題。當你有上百萬筆資料時,這很浪費。攤銷推論改為訓練單一個共享的神經網路,一個編碼器,它看任何輸入都能在單次前向傳遞中預測其後驗參數。你只在前期付一次訓練成本,之後對新資料點的推論就只是一次函數計算。
這個推論網路,也就是識別模型,在所有資料點之間共享,其權重與生成模型一起透過最大化 ELBO 來最佳化,並用重參數化技巧取得低變異數的梯度。這正是變分自編碼器的編碼器;它把推論的成本攤銷到整個資料集上,並且額外地能在測試時推廣到未見過的輸入,無需任何逐範例的最佳化。
好處是速度與可擴展性,常數時間的推論,是變分自編碼器與許多深度潛在變數模型的骨幹。代價是攤銷落差(amortization gap):單一網路無法為每個輸入輸出精確最優的變分參數,因此其近似後驗系統性地比逐資料點的變分推論更鬆。半攤銷方法以幾步梯度精修編碼器的輸出,來縮小部分落差。
又称
另见