貝氏深度學習

證據式深度學習(evidential deep learning)

證據式網路不必取樣許多次來估計不確定性,而在單次前向傳遞中直接輸出不確定性。它的做法是預測的不是一個點答案,而是一個「分布的分布」的參數:分類時是類別機率單純形上的狄利克雷分布,迴歸時是均值與變異數上的常態-逆伽瑪分布。那個高階分布的集中程度,被解讀為「模型握有多少證據」。

這個想法位於主觀邏輯與證據理論的框架中:總集中度很大的狄利克雷代表一個尖銳的意見(高證據、低知識不確定性),而集中度接近均勻先驗則意味「我不知道」。Sensoy 等人(分類)與 Amini 等人(迴歸)用一個損失來訓練它,一方面擬合資料,另一方面以正則化項把模型無法解釋的樣本之證據驅向零,使單一網路便宜地同時回報偶然與知識不確定性。

它的吸引力在於速度:不必集成、不必取樣,推論時是確定性的不確定性。但這套方法也招致尖銳批評。它的知識不確定性訊號並非來自正規的後驗,可能校準不良,高度依賴正則化項與訓練用的分布外資料,而且在真正新奇的輸入上未必會增長。把它當作快速的啟發法,而非貝氏保證。

又稱
證據式深度學習evidential networks