統計解碼與機器學習基礎

類別不平衡

當各類別出現頻率不均——常見於 ErrP 偵測(錯誤少)、P300(罕見目標混於頻繁非目標中,常為 1:5 或更懸殊)或癲癇與事件偵測——分類器可僅藉由預測多數類來最大化準確率,使原始準確率變得毫無意義。而所關注的訊號恰是罕見類。

對策作用於三個層級:指標(用平衡準確率、精確率/召回率、F1、ROC-AUC 或 Cohen kappa 而非準確率)、資料(重取樣——對多數類下取樣、對少數類上取樣,或以 SMOTE 合成)與演算法(類別加權損失、調整決策閾值,或將 LDA 的先驗設為運作時而非訓練時的類別頻率)。正確的決策閾值取決於應用中漏報相對於誤報的成本,此成本應被明確陳述。

P300 拼字器每 6 次閃爍約見 1 個目標。將一切標為非目標的偵測器有 83% 準確率卻毫無用處;拼字器需要在受控的偽陽率下有高目標召回,並以 ROC 曲線下面積、或在證據累積後的字元選擇準確率來評估。

不平衡下準確率具誤導性。

重取樣只能在交叉驗證的訓練折內進行;在切分前上取樣會把少數類實例複製進訓練與測試兩邊,是典型的洩漏。