統計解碼與機器學習基礎
資料洩漏
任何使測試集(或標籤)資訊進入訓練的路徑,都會產生無法在線上重現的評估。在神經資料中它藏於許多地方:在交叉驗證前於整份資料上擬合空間濾波器、ICA、CSP、PCA、標準化統計、假影閾值或特徵選擇排序;藉偷看測試表現來選擇時間窗或頻帶;或在試次時間相依時做隨機切分。
原則是每個依賴資料的步驟都必須位於交叉驗證迴圈之內,僅由各折的訓練資料估計、再套用於其測試資料。循環分析——以某對比選出體素、通道或時間點,再於同一資料上量測效果量——是神經科學特有的形式,即使在虛無假設下也會灌大效果。
在全部試次上計算 CSP 濾波器、再只對分類器做交叉驗證,即為洩漏:CSP 已透過類別共變異數見過測試標籤。在每個訓練折內重新擬合 CSP 可移除此洩漏,通常也會降低所報告的準確率。
每個依賴標籤的步驟都須進入折內。
洩漏產生離線看來極佳、上線即崩潰的結果。由於它在混淆矩陣中不可見,唯一的防線是有紀律的管線建構,以及理想上僅評估一次的真正保留場次。
又称
另见