影像分類
標籤平滑 (label smoothing)
標籤平滑是一種讓訓練目標變柔和的正規化技巧。它不再告訴網路正確類別的機率是 1、其他每個類別都是 0(也就是硬性的 one-hot 目標),而是給正確類別 1 減去 epsilon 的機率,並把剩下的 epsilon 均勻地分散到其他類別上。常見的取值是 epsilon 等於 0.1,使真實類別得到 0.9,其餘 0.1 由其他類別分享。
其動機在於:硬性目標會推動網路把正確的 logit 拉到無限大於其他 logit,促成過度自信、尖銳的輸出,使泛化變差且校準不良。把目標稍微變柔和後,標籤平滑會懲罰過於極端的 logit 落差,因而起到正規化的作用,在像 ImageNet 這樣的大型基準上往往能提升前 1 準確率,並且顯著改善校準,使預測機率更能反映真實的正確率。
它實作起來基本上是免費的,因為只有目標向量改變,交叉熵損失本身不變,這正是它出現在大多數現代訓練配方中的原因。主要的但書是:它所誘導出較緊、較均勻的特徵叢集,可能稍微傷害那些依賴倒數第二層特徵幾何結構的下游用途,例如知識蒸餾,因為一個用大量標籤平滑訓練出的老師模型能傳遞的資訊較少。
對一個 epsilon = 0.1 的 5 類別問題,像 [0, 1, 0, 0, 0] 這樣的硬性目標會變成柔性目標 [0.025, 0.9, 0.025, 0.025, 0.025],因此網路永遠不會被訓練去把非目標的機率一路壓到 0。