評估與指標

混淆矩陣(confusion matrix)

/ kun-FYOO-zhun MAY-triks /

混淆矩陣是對一個分類器表現的誠實、完整的拆解——一張小表格,把每一個預測都歸入四個格子之一。一條軸是真相(它實際上是「是」還是「否」),另一條軸是模型的猜測(它說了「是」還是「否」)。四個格子分別是:真正例(說是,確實是)、真反例(說否,確實否)、假正例(說是,其實否——一次誤報)、假反例(說否,其實是——一次漏判)。

它之所以叫混淆矩陣,是因為它精確地顯示出模型在哪裡犯糊塗:它把哪些真實的東西錯認成了哪些別的東西。幾乎所有其他指標——準確率、精確率、召回率、F1——都不過是從這四個數裡擠出來的不同算術罷了。矩陣是原始的真相,指標只是對它的摘要。

它最大的優點,是它拒絕隱瞞所犯錯誤的「種類」。兩個模型可以有相同的準確率,矩陣卻天差地別——一個誤報成癮,一個膽小怕事、漏掉了真案例。由於誤報和漏判在現實世界裡往往代價大不相同,在敲定任何單一分數之前先看完整的矩陣,是評估中最有用的習慣之一。當類別多於兩個時,它會長成一張更大的方格表,每個類別佔一行一列。

100封郵件,其中30封確實是垃圾。過濾器的矩陣為:真正例25,假反例5(漏過去的垃圾郵件),假正例8(被誤刪的真郵件),真反例62。由此可得:精確率25/33≈76%,召回率25/30≈83%,準確率87/100=87%。

所有那些搶眼的指標,不過是對矩陣四個格子做的算術。

「哪條軸是列、哪條是欄」的約定,在不同教科書和軟體之間並不統一,所以讀別人的矩陣前一定要先看清標籤——一個轉置過的矩陣會把假正例和假反例對調,悄無聲息地把你的結論顛倒過來。

又稱
混淆矩阵混淆矩陣error matrix误差矩阵