概率与贝叶斯方法

不确定性量化(uncertainty quantification)

/ un-SUR-tun-tee kwon-tih-fih-KAY-shun /

不确定性量化,是一门让模型不仅说出「这是我的答案」、还说出「以及我有多确信」的功夫。一份说「70%的概率会下雨」的天气预报,就在做这件事;一辆说「我有99%的把握那是行人,但对那道阴影只有40%的把握」的自动驾驶车,也在做这件事。要点在于,为每一个预测都系上一个诚实的置信度,好让下游的决策能把一个摇摇欲坠的猜测,与一个稳稳当当的结论区别对待。

把不确定性分成两种,会有帮助。一种,是这个世界里固有、无法消减的噪声——一枚公平硬币的结果,无论你研究多久都是不确定的。另一种,是你自身的无知,而更多的数据能把它缩小——是对某个你只是测得不够多的量的不确定。这一区分要紧,因为它们要求不同的应对:第一种你没法靠收集数据来减少,第二种你却可以。一个好的系统,会告诉你哪个是哪个。

它为何重要:在高风险的场合——医疗、金融、自主机器——一个带着虚假自信端出的错误答案,远比一个亮明自身疑虑的答案危险得多。诚实而令人不安的真相是:大多数标准的机器学习模型,尤其是深度神经网络,出了名地过度自信:它们吐出的那些概率数字,往往与它们真实的准确率对不上号——口口声声99%确信,答对的次数却远没那么多。产出可信、经过校准的不确定性是件难事,至今仍是一个活跃的难题;一个会报告不确定性的模型,并不自动等于一个「其不确定性值得你信任」的模型。

两个皮肤病变分类器,都把一颗痣标为「良性」。第一个只说「良性」。第二个则说「良性,但我的置信度只有55%,而且这张图与我训练数据里的大多数都不像」——它同时亮出了低置信与陌生病例两件事。医生只有在第一种被良好校准时,才能放心据它行事;第二种则招来一次复看,而这恰恰是不确定性量化派上用场的时刻。

报出一个置信度数字,只有在它被校准时才有用——一个真有55%命中率的「55%」,而非其实有90%。

必须戳破的关键误解:一个模型吐出一个置信度分数,并不等于那个分数值得信赖。现代深度网络系统性地过度自信,所以一个未经校准的「99%」可能比根本不给数字还糟,它会哄你去信任一个错误的答案。

又称
UQ不确定性量化不確定性量化不确定度量化