貝氏深度學習
貝氏模型平均(BMA)
當好幾個模型都能解釋你的資料時,貝氏模型平均拒絕只挑一個。它不選單一最佳假設,而是對所有模型平均來做預測,依各自在給定資料下的可信度——也就是後驗機率——加權。擬合得好又先驗合理的模型得到大票;過擬合或不合理的則只得小票。
預測分布是每個模型的預測乘上參數或模型後驗的積分。這是真正貝氏的答案,也是本領域所有方法試圖近似的目標:MC dropout、深度集成、SGLD 樣本與拉普拉斯樣本,都是抽取你接著要平均的那些參數設定的辦法。關鍵是,BMA 並不是把模型組合起來造出更好的單一模型;它是反映「我們對哪個模型才對」這份誠實不確定性的邊際化。
Wilson 與 Izmailov 主張,貝氏深度學習之所以有幫助,正是因為這種對多盆地後驗的邊際化,而深度集成是出乎意料地好的 BMA。一個微妙之處:在模型設定錯誤時,真正的貝氏後驗可能集中於單一模型而平均得很差,這就連到了冷後驗效應——有時調溫後的後驗反而平均得比精確的更好。
p(y\mid x,\mathcal{D})=\int p(y\mid x,\theta)\,p(\theta\mid\mathcal{D})\,d\theta
把預測對參數後驗做邊際化,而不是固定單一模型。
又稱
另見