你的 90% 真的是 90% 嗎?
不確定性唯有誠實才值得擁有,而誠實的第一個檢驗是校準:在模型說自己有 90% 信心的所有時候,它是不是大約 90% 的時間是對的?可靠度圖把預測依宣稱的信心分箱,並對它畫出準確率;期望校準誤差(ECE)摘要那個落差。深度網路出了名地過度自信,而且——關鍵一點——變得更準確完全無助於修正這點。準確率與校準是兩條分開的軸。
期望校准误差:将置信度分箱后,置信度与实际准确率之差按样本数加权平均。
好消息:多數貝氏深度學習方法會把校準作為平均的副作用而改善——深度集成尤其如此。要當心的是:校準通常是在分布內衡量的,而它在分布偏移下會急遽惡化。一個在乾淨測試資料上校準好的模型,在被汙染或偏移的輸入上可能極度過度自信——而那正是你最需要它謙遜的時候。
不需要正確模型的保證
目前為止所有貝氏的東西,給的不確定性只在先驗與近似可信的範圍內可信。共形預測給出一個截然不同、令人驚訝的承諾:一個有限樣本、無分布假設的覆蓋保證。挑一個目標如 90%,共形就會輸出一個預測集合(一組標籤,或一個區間),可被證明至少 90% 的時間包含真值——不假設你的模型正確,除了可交換性之外不對資料分布做任何假設。
- 訓練任何你喜歡的模型——貝氏網路、樸素分類器,什麼都行;共形把它當黑箱包起來。
- 在一個留存的校準集上,用一個非一致性分數(例如 1 減去真標籤的 softmax 機率)為每個樣本評分。
- 在你的目標水準取那些分數的經驗分位數——這個門檻就是你需要的全部校準。
- 對一個新輸入,輸出所有分數低於門檻的標籤;這個集合的大小,現在就是你的不確定性訊號。
共形预测的保证:对任意模型、任意分布,预测集合以至少 1 减 α 的概率覆盖真实标签。
永遠學下去而不遺忘
貝氏對持續學習有一個優雅的回答:當新任務到來,昨天的後驗變成今天的先驗。變分持續學習就跑這個遞迴——在任務 1 上配一個變分後驗,把它當作任務 2 的先驗帶過去,依此類推。第一個任務釘死的權重,被那個先驗錨住、抗拒被覆寫——這正是普通微調所缺乏、對抗災難性遺忘的保護。
贝叶斯持续学习的递推形式:昨天的后验成为今天的先验,一个任务接一个任务。
同一個遞迴也支撐了像彈性權重固化(EWC)這類流行的正則化器——它本質上就是一個在任務間帶著走的拉普拉斯先驗。限制很誠實:這條鏈只跟每一步後驗近似一樣好,而誤差會在一長串任務上累積,所以常常會再加一小批重放樣本(coreset),以防遞迴漂走。
誠實的限制
這個領域的去向
有三股潮流值得關注。第一,把不確定性擴展到基礎模型:完整的貝氏深度學習對十億參數網路遙不可及,所以戰場在最後一層拉普拉斯、LoRA 式低秩後驗,以及便宜的轉接器集成。第二,為決策服務的不確定性,目標不再是一個校準過的數字,而是一個更好的下游行動——用於主動學習、實驗設計與安全部署。第三,貝氏模型平均、深度集成與共形保證之間一場緩慢的和解——社群正逐漸接受:沒有任何單一框架獨佔「可信賴的預測」。
神经缩放定律曲线:在对数-对数坐标上,损失随模型与数据规模增大而下降。