貝氏深度學習

拉普拉斯近似(Laplace approximation)

先找到後驗的山峰,再把它當成一個鐘形曲線。你先照常訓練得到 MAP 估計,也就是後驗的眾數,再擬合一個高斯——中心放在那個峰值,寬度由後驗在該處彎曲的陡峭程度決定:曲率窄代表高度確定,平坦的區域則代表不確定。

這個寬度就是負對數後驗在峰值處的海森(Hessian)矩陣之反矩陣。實務上海森常以費雪資訊或高斯-牛頓/GGN 近似取代,而對深度網路即使這樣仍太大,於是再加以因子化為對角矩陣、克羅內克因子化(KFAC)矩陣,或僅限於末層。一個乾淨的現代配方是線性化拉普拉斯:保持訓練好的權重不動,只在事後加上高斯,幾乎免費地得到不確定性。

它最大的優點是身為事後(post-hoc)方法,不必更動訓練、直接重用你已有的網路,laplace-redux 函式庫讓它變得開箱即用。缺點是單一高斯只能圍繞一個峰值,無法表達深度網路真正多峰、重尾的後驗,而品質完全取決於你負擔得起的海森近似有多好。

p(\theta\mid\mathcal{D})\approx\mathcal{N}\!\left(\theta_{\mathrm{MAP}},\,H^{-1}\right),\quad H=-\nabla^2\log p(\theta\mid\mathcal{D})\big|_{\theta_{\mathrm{MAP}}}

以 MAP 峰值為中心、共變異數為負對數後驗之海森反矩陣的高斯。

又称
拉普拉斯近似