JOVANA
Explore Library Glossary Getting Started Three Levels Fields How it works Mission
Join the mission
All guides

可信賴的預測:校準、共形、持續學習與開放問題

不確定性能不能被信任——校準指標、無分布假設的共形保證、貝氏持續學習,以及這個領域誠實的開放問題。

你的 90% 真的是 90% 嗎?

不確定性唯有誠實才值得擁有,而誠實的第一個檢驗是校準:在模型說自己有 90% 信心的所有時候,它是不是大約 90% 的時間是對的?可靠度圖把預測依宣稱的信心分箱,並對它畫出準確率;期望校準誤差(ECE)摘要那個落差。深度網路出了名地過度自信,而且——關鍵一點——變得更準確完全無助於修正這點。準確率與校準是兩條分開的軸。

\mathrm{ECE}=\sum_{m=1}^{M}\frac{|B_m|}{n}\,\bigl|\,\mathrm{acc}(B_m)-\mathrm{conf}(B_m)\,\bigr|

期望校准误差:将置信度分箱后,置信度与实际准确率之差按样本数加权平均。

好消息:多數貝氏深度學習方法會把校準作為平均的副作用而改善——深度集成尤其如此。要當心的是:校準通常是在分布內衡量的,而它在分布偏移下會急遽惡化。一個在乾淨測試資料上校準好的模型,在被汙染或偏移的輸入上可能極度過度自信——而那正是你最需要它謙遜的時候。

不需要正確模型的保證

目前為止所有貝氏的東西,給的不確定性只在先驗與近似可信的範圍內可信。共形預測給出一個截然不同、令人驚訝的承諾:一個有限樣本、無分布假設的覆蓋保證。挑一個目標如 90%,共形就會輸出一個預測集合(一組標籤,或一個區間),可被證明至少 90% 的時間包含真值——不假設你的模型正確,除了可交換性之外不對資料分布做任何假設。

  1. 訓練任何你喜歡的模型——貝氏網路、樸素分類器,什麼都行;共形把它當黑箱包起來。
  2. 在一個留存的校準集上,用一個非一致性分數(例如 1 減去真標籤的 softmax 機率)為每個樣本評分。
  3. 在你的目標水準取那些分數的經驗分位數——這個門檻就是你需要的全部校準。
  4. 對一個新輸入,輸出所有分數低於門檻的標籤;這個集合的大小,現在就是你的不確定性訊號。
\mathbb{P}\bigl(Y_{n+1}\in\mathcal{C}(X_{n+1})\bigr)\ge 1-\alpha

共形预测的保证:对任意模型、任意分布,预测集合以至少 1 减 α 的概率覆盖真实标签。

永遠學下去而不遺忘

貝氏對持續學習有一個優雅的回答:當新任務到來,昨天的後驗變成今天的先驗變分持續學習就跑這個遞迴——在任務 1 上配一個變分後驗,把它當作任務 2 的先驗帶過去,依此類推。第一個任務釘死的權重,被那個先驗錨住、抗拒被覆寫——這正是普通微調所缺乏、對抗災難性遺忘的保護。

p(\theta\mid\mathcal{D}_{1:t})\;\propto\;p(\mathcal{D}_t\mid\theta)\,p(\theta\mid\mathcal{D}_{1:t-1})

贝叶斯持续学习的递推形式:昨天的后验成为今天的先验,一个任务接一个任务。

同一個遞迴也支撐了像彈性權重固化(EWC)這類流行的正則化器——它本質上就是一個在任務間帶著走的拉普拉斯先驗。限制很誠實:這條鏈只跟每一步後驗近似一樣好,而誤差會在一長串任務上累積,所以常常會再加一小批重放樣本(coreset),以防遞迴漂走。

誠實的限制

  1. 先驗是個我們極少真正理解的虛構。權重上的高斯是為了方便、而非為了信念而選的,而冷後驗效應就是那份不匹配寄來的帳單。
  2. 分布外偵測尚未解決。沒有方法能可靠地標記出每一個它該標記的輸入;分布外偵測在對抗性與近分布的輸入上仍會失手。
  3. 不確定性有計算代價——取樣、集成、海森矩陣——而誠實的問題永遠是:一個更便宜的基線加上共形,是不是就夠了。
  4. 近似後驗可能自信地出錯。一個收得很緊的平均場高斯,可能正好在真實後驗很寬之處回報低不確定性——虛假謙遜那個邪惡的雙胞胎。

這個領域的去向

有三股潮流值得關注。第一,把不確定性擴展到基礎模型:完整的貝氏深度學習對十億參數網路遙不可及,所以戰場在最後一層拉普拉斯、LoRA 式低秩後驗,以及便宜的轉接器集成。第二,為決策服務的不確定性,目標不再是一個校準過的數字,而是一個更好的下游行動——用於主動學習、實驗設計與安全部署。第三,貝氏模型平均、深度集成共形保證之間一場緩慢的和解——社群正逐漸接受:沒有任何單一框架獨佔「可信賴的預測」。

基础模型沿着缩放定律曲线前进;把可信的不确定性带入这种十亿参数规模,正是尚未解决的前沿。

神经缩放定律曲线:在对数-对数坐标上,损失随模型与数据规模增大而下降。