评估与指标
AUC(曲线下面积)
/ AY-yoo-SEE /
AUC——曲线下面积(area under the curve)——把整条ROC曲线浓缩成一个数字:它下方那块面积的大小。由于ROC曲线住在一个1×1的方框里,AUC的取值从0到1。一个完美的分类器得1.0;纯靠瞎猜得0.5;而低于0.5的分数,意味着模型竟然比抛硬币还差(这往往是个信号:你把标签搞反了)。
它有一个很美的大白话含义。AUC是这样一个概率:如果你随机挑出一个真正的正例和一个真正的反例,模型给正例打的分高于给反例打的分,这件事发生的可能性。AUC等于0.85,意味着它有85%的时候排序排对了。所以AUC衡量的是排序质量——模型把两个类别分开的本事——而与你把判定阈值设在哪里无关。
这种「与阈值无关」既是它的魅力,也是它的局限。AUC便于一眼比较多个模型,而不必先承诺一个切分点。但它对「模型的分数是不是校准良好的概率」只字不提,而且在稀有事件问题上,即便模型在实际中几乎没用,它也可能稳稳地保持得高高的。对于不平衡的数据,精确率-召回率曲线下的面积(PR-AUC)通常是更诚实的概括。
两个信用模型:A的AUC为0.78,B为0.81。B在「随机一个按时还款者排在随机一个违约者之上」这件事上略微更频繁,说明它是更好的区分器——但要真正用它,你仍得挑一个阈值,并在那个阈值处检查精确率和召回率,然后才好上线。
AUC给模型排座次,但要真正部署一个,你仍得自己挑一个阈值。
「AUC」默认指ROC曲线下的面积,但人们也会把精确率-召回率曲线下的面积叫AUC。这是两个不同的数字,各有所长——在不平衡数据上它们可能给出截然不同的结论。一定要确认对方说的是哪条曲线。
又称
另见