貝氏深度學習

深度集成(deep ensembles)

最簡單卻有效的做法:用不同的隨機初始化與資料洗牌順序把同一個網路訓練好幾次,再把它們的預測平均起來。因為損失地景布滿許多同樣好但彼此不同的盆地,獨立的訓練會收斂到真正不同的函數,它們在資料密集處意見一致、在資料稀疏處彼此分歧——而這份分歧就是可用的不確定性訊號。

Lakshminarayanan 等人最初把它當作非貝氏的替代方案,但如今多被解讀為一種粗糙的後驗近似:每個成員是一個 MAP 或最大概似的眾數,整個集成則是對眾數的均勻加權取樣,捕捉到拉普拉斯近似或平均場變分推論這類單眾數方法所漏掉的多峰結構。預測分布是各成員的混合:分類時平均 softmax 機率,迴歸時平均高斯輸出。

經驗上,深度集成是多數基準上最強、校準最好的不確定性方法,在分布偏移下也很穩健,因此是其他方法的衡量標竿。代價是線性的:M 倍的訓練成本、推論成本與記憶體。各種變體(快照集成、batch ensembles、多輸入/多輸出網路)試圖以更低成本保留大部分好處。

又称
深度集成