影像分類
溫度縮放 / 校準 (temperature scaling / calibration)
當一個分類器的信心與它的準確率相符時,它就是校準良好的:在它以 80% 信心做出的所有預測中,大約應有 80% 是正確的。現代深度網路通常過度自信,動輒輸出 99% 的信心,正確率卻遠低於此;只要機率本身就在驅動某個決策(例如把不確定的醫療案例轉交給人類),這就是危險的。校準就是修正這種不相符的行為,而溫度縮放是其中最簡單、最受歡迎的方法。
溫度縮放把 logits(softmax 之前的分數)除以一個在保留的驗證集上學到的單一正純量 T,再照常套用 softmax。T 大於 1 會讓分佈變柔和、降低過於膨脹的信心,而 T 小於 1 則會讓它變尖銳。由於 T 是一個對所有 logits 等比例縮放的數字,它永遠不會改變哪個類別是 argmax,因此能在完全不更動準確率的情況下改善機率,是難得的免費午餐。T 是藉由在驗證集上最小化負對數概似(或期望校準誤差)來擬合的。
校準品質通常以期望校準誤差(ECE)來概括,其計算方式是把預測依信心分桶,並在每個桶中衡量信心與準確率之間的平均落差,並以可靠度圖(reliability diagram)來視覺化。溫度縮放是標準上會先嘗試的方法;更豐富的替代方案,如向量或矩陣縮放,以及 Dirichlet 校準確實存在,但有過度擬合的風險,而且可能改變預測。
一個在那些案例上有 99% 信心、卻只有 90% 準確的網路,可以藉由學到一個大於 1 的 T(比方說 1.5)來修正,使它的平均信心降到約 90% 而與現實相符,同時每一個前 1 預測(因而它的準確率)維持完全不變。
又称