评估与指标

概率校准(calibration of probabilities)

/ kal-ih-BRAY-shun uv prob-uh-BIL-ih-teez /

一个输出概率的模型,如果它的自信程度从长远看与现实相符,就叫校准良好。想想天气预报员:在他所有说「70%的可能下雨」的日子里,实际上应该大约有70%的时候真的下了雨。如果那些日子里只有40%下了雨,那这位预报员就是过度自信——他的数字并不是它们声称的那个意思。校准,说的就是一个报出来的概率能不能照字面来信。

这和「准确」是两码事,且并不由「准确」推出。一个模型可以非常擅长「给案例排序、判断谁比谁更可能」——AUC很高、准确率很棒——而它实际报出的那些概率数字却严重失准,系统性地偏高或偏低。现代神经网络以过度自信而臭名昭著:它们会乐呵呵地对「只有80%时候是对的」的答案报出99%的确信。要检查校准,你把预测按它们声称的自信程度分组,看看每一组真实的成功率是否对得上。

它为何极其重要:一旦一个概率被用来喂养一个决策,它的诚实就成了全部的关键。一位权衡治疗方案的医生、一家定利率的放贷机构、一辆判断风险的自动驾驶汽车——全都需要那个数字「言为心声」,而不只是把东西排对序。让人安心的消息是:校准往往可以在训练之后修补,用一些简单的技术,温和地把输出拉伸或压缩(比如Platt缩放或温度缩放),而不必把整个模型重新训练。一个听起来自信的模型,并不等于一个可信赖的模型,而校准,正是你把这两者分辨开来的办法。

把模型说过「80%确信」的每一个案例都收集起来。如果它在其中大约80%上确实是对的,那它就是校准的。如果它只在60%上是对的,那它就过度自信了——一位照字面信任那个「80%」的医生或信贷员,就会被系统性地误导,哪怕这模型整体的准确率看起来还不错。

校准检验:「80%确信」真的会在80%的时候成真吗?

校准和准确是相互独立的:一个模型可以准确却校准得很糟,也可以校准良好却并不准确。在没先检查校准之前,别把一个自信分数当真理来读——而且要记住,在一个人群上测出的校准,当模型遇上来自不同分布的数据时,可能就会失效。

又称
概率校准機率校準probability calibrationmodel calibration校准