數據與特徵

抽樣與重抽樣(sampling and resampling)

/ SAM-pling and ree-SAM-pling /

抽樣,就是挑選哪些例子能進入你的資料集——好比民意調查員挑出幾千個人來代表整個國家。挑得好,一個小樣本就能忠實地映照出更大的總體;挑得草率(比如只打固定電話),你就把一種偏差烤進了資料,日後再高明的建模也無法把它去掉。重抽樣則是與之相關的做法:從你已有的資料裡抽出新的選擇,用以重新平衡資料或衡量不確定性。

好的抽樣力求有代表性。隨機抽樣讓每個人機會均等;分層抽樣則刻意按比例保留重要的子群(這樣一份全國調查就能保住它的年齡結構)。重抽樣技術為特定任務而複用已有資料:過抽樣(oversampling)對罕見類進行複製或生成更多,欠抽樣(undersampling)則丟掉一些過於常見的類(兩者都用來對抗類別不平衡),而自助法(bootstrap)則反覆地有放回隨機抽樣,用以估計「若當初採到的資料略有不同,結果會抖動多少」。

為何重要:每個模型都默默假設它的訓練樣本反映了它將被使用的那個世界;一旦這個假設破裂,模型就會在它從未見過的那些情形上自信地犯錯。透過重抽樣來重新平衡,能幫模型注意到一個罕見類,但它是一把雙刃劍——欠抽樣會扔掉真實資料,而過抽樣則可能讓模型把那些被複製的罕見樣本背了下來。這一切都沒有增添真正的新資訊;它只是把你已經擁有的東西重新分配了一下。

1936年,一家雜誌根據數百萬份回函預測了一場美國大選——但它只寄給了自己那些富裕的訂戶和有車的人,於是這個龐大的樣本嚴重偏斜,把結果預測錯了。而一位只用了幾千名精心平衡受訪者的民調人卻預測對了。規模,敗給了代表性。

數百萬份有偏的回函,輸給了幾千份有代表性的回答。

為應對類別不平衡而重抽樣時,只對訓練集動手——絕不要碰測試集。先過抽樣、後劃分,會讓同一個例子的副本落到劃分的兩側,這是資料洩漏的典型教科書案例。

又稱
oversamplingundersamplingbootstrap采样重采样過採樣欠採樣抽樣重抽樣