評估、穩健性與倫理

模型校準

校準探問的是:模型的信心度是否名實相符。當分類器輸出「我有 90% 把握這是貓」,一個校準良好的模型,在它所有說「90%」的案例中,大約有 90% 真的答對。這與準確率不同:準確率問的是最高猜測是否正確;校準問的是「附上的機率是否誠實」。一個模型可以很準確卻過度自信(宣稱 99%,實際只對 80%),這在「信心度會驅動下游決策」之處非常危險——自駕車決定是否煞車、醫療系統決定是否交還給醫師判斷。

要把這點講精確,就把預測依其宣稱的信心度分組,並檢查每一組實際答對的頻率。一個完美校準的模型滿足:在所有以信心度 p 做出的預測中,經驗準確率等於 p,對每一個 p 皆然。可靠度圖(reliability diagram)將此視覺化——把預測依信心度分箱(例如 0–10%、10–20%……),在 x 軸畫出各箱的信心度、y 軸畫出各箱的準確率;理想是那條 45 度對角線。長條落在對角線之下代表過度自信;落在之上代表信心不足。

標準的純量摘要是期望校準誤差(ECE):把預測依信心度分箱,對每一箱取「其平均信心度與實際準確率之間的絕對差距」,再以各箱樣本數為權重平均這些差距。ECE 接近 0 代表校準良好;ECE 大代表信心度系統性偏差。相關量度還包括最大校準誤差(最糟的那一箱),以及如負對數似然與 Brier 分數等真確評分規則(proper scoring rule),它們直接獎勵「校準過的機率」,而不必透過分箱。

一個著名的發現是:現代深度網路校準得很差,而且通常過度自信——2017 年的一項研究指出,準確率自 AlexNet 時代以來提升了,校準卻變糟,部分原因是「高容量模型搭配交叉熵訓練」會被推向接近 1 的 softmax 輸出。常見的修法是事後且廉價的:溫度縮放(temperature scaling)在 softmax 之前把 logits 除以單一學到的純量 T,柔化過於尖銳的分佈,卻不改變哪一類別勝出(因此準確率毫髮無傷);Platt 縮放、保序迴歸(isotonic regression),以及集成/深度集成也有幫助。校準之所以重要,正是因為太多安全關鍵與決策理論用途,會把那個 softmax 數字當成真正的機率——而未經校準時,它並不是。

校準與準確率是正交的:你可以準確卻校準不良,也可以校準完美卻不準確(例如在平衡的擲硬幣任務上永遠說「50%」的模型,校準良好卻毫無用處)。請兩者都回報,並記得溫度縮放需要一個保留的驗證集來擬合 T——在測試集上擬合會洩漏資訊。

又稱
confidence calibrationECEreliability diagramexpected calibration error