貝氏深度學習
冷後驗效應(cold posterior effect)
貝氏深度學習核心的一個謎。理論上,用真正的貝氏後驗來預測應該是最優的。但實務上 Wenzel 等人發現:對深度網路而言,把後驗銳化,將它升到 T 分之一次方、溫度 T 小於一,反而能得到更好的準確率與概似,等於比貝氏所說的更信任資料。「冷」後驗,T 小於一,勝過 T 等於一的真正後驗,這令人不安。
調溫後驗就是把貝氏後驗升到 T 分之一次方:T 等於一時是精確貝氏,而當 T 趨近零時它塌縮為 MAP 估計。這個效應就是「測試效能往往隨 T 降到一以下而單調改善」這個觀察。提出的解釋包括:資料增強讓有效概似把每筆資料數算多次,所以真正的 T 隱含小於一、我們放在權重上的先驗很差而過度正則化、概似設定錯誤,以及資料集的篩選破壞了獨立同分布的生成假設。究竟哪個原因主導仍有爭議。
冷後驗效應之所以重要,是因為它質疑:我們近似推論的勝利,究竟來自「身為貝氏」,還是來自無意間下調了一個壞先驗的權重。後續工作主張其中大部分是資料增強與篩選的產物,而非貝氏的深層失敗,但它仍是「別把深度網路的後驗照單全收」這項警世故事的標準範例。
p_T(\theta\mid\mathcal{D})\propto\big(p(\mathcal{D}\mid\theta)\,p(\theta)\big)^{1/T},\qquad T<1
調溫後驗把貝氏後驗升到 T 分之一次方;T 小於一使其更銳利。
又稱
另見