評估與指標

機率校準(calibration of probabilities)

/ kal-ih-BRAY-shun uv prob-uh-BIL-ih-teez /

一個輸出機率的模型,如果它的自信程度從長遠看與現實相符,就叫校準良好。想想天氣預報員:在他所有說「70%的可能下雨」的日子裡,實際上應該大約有70%的時候真的下了雨。如果那些日子裡只有40%下了雨,那這位預報員就是過度自信——他的數字並不是它們聲稱的那個意思。校準,說的就是一個報出來的機率能不能照字面來信。

這和「準確」是兩碼事,且並不由「準確」推出。一個模型可以非常擅長「給案例排序、判斷誰比誰更可能」——AUC很高、準確率很棒——而它實際報出的那些機率數字卻嚴重失準,系統性地偏高或偏低。現代神經網絡以過度自信而臭名昭著:它們會樂呵呵地對「只有80%時候是對的」的答案報出99%的確信。要檢查校準,你把預測按它們聲稱的自信程度分組,看看每一組真實的成功率是否對得上。

它為何極其重要:一旦一個機率被用來餵養一個決策,它的誠實就成了全部的關鍵。一位權衡治療方案的醫生、一家定利率的放貸機構、一輛判斷風險的自動駕駛汽車——全都需要那個數字「言為心聲」,而不只是把東西排對序。讓人安心的消息是:校準往往可以在訓練之後修補,用一些簡單的技術,溫和地把輸出拉伸或壓縮(比如Platt縮放或溫度縮放),而不必把整個模型重新訓練。一個聽起來自信的模型,並不等於一個可信賴的模型,而校準,正是你把這兩者分辨開來的辦法。

把模型說過「80%確信」的每一個案例都收集起來。如果它在其中大約80%上確實是對的,那它就是校準的。如果它只在60%上是對的,那它就過度自信了——一位照字面信任那個「80%」的醫生或信貸員,就會被系統性地誤導,哪怕這模型整體的準確率看起來還不錯。

校準檢驗:「80%確信」真的會在80%的時候成真嗎?

校準和準確是相互獨立的:一個模型可以準確卻校準得很糟,也可以校準良好卻並不準確。在沒先檢查校準之前,別把一個自信分數當真理來讀——而且要記住,在一個人群上測出的校準,當模型遇上來自不同分佈的數據時,可能就會失效。

又稱
概率校准機率校準probability calibrationmodel calibration校准