迴歸與預測建模

訓練/驗證/測試切分

這是把資料切成幾塊、好讓你誠實評斷模型的基本紀律。你在訓練集(training set)上配適模型,在驗證集(validation set)上調整選擇與比較模型,最後才在從未碰過的測試集(test set)上量測最終表現。

重點在於:用模型讀過的資料去打分數,既好看又會誤導;測試集模擬的是模型在真實世界裡將要面對的、全新而未見的資料。最大的罪是「資料洩漏」(leakage)——讓測試集的任何資訊滲進訓練(哪怕是偷看它之後所做的選擇),這會讓你回報的表現變成一場幻覺。

又稱
holdout set