數據與特徵
離群值(outlier)
/ OWT-ly-er /
離群值是一個遠離大眾的資料點——就是那個讓你忍不住再看一眼的值。在一個人人考60到90分的班裡,單單一個5分就是離群值。它也許是一個真實的極端案例,也許是一處錯誤;把這兩者分辨開來,正是這項工作的大半。
離群值出自兩個截然不同的來源。有些是錯誤:手滑打錯的數字(把一個人的體重寫成1500公斤)、壞掉的感測器、單位搞混。另一些則真實但罕見:一筆確實巨額的交易、一位的確不尋常的病人。關鍵在於,你無法僅憑那個數字就判斷它屬於哪一種——你必須去調查。從統計上看,離群值常被識別為「離均值許多個標準差」的值,或落在資料主體之外很遠處,但被標記出來只是一份「請你去看一看」的邀請,而非一道「自動刪除」的判決。
為何重要:寥寥幾個極端點就能拉偏一個平均值、扭曲一條擬合的直線,並主導基於尺度的預處理,結果模型變得只盯著那些怪胎、而非典型情形。但盲目刪除離群值是危險的——在詐欺偵測或罕見病篩查裡,離群值恰恰正是你要找的東西。誠實的做法是:弄清每個離群值的成因,再做選擇:修正它、保留它、給它封頂,或為它單獨建模。這裡沒有放之四海皆準的規則。
一個團隊的平均薪資大約是6萬美元,直到把創辦人那500萬的數字算進來——這下「平均值」一躍成了55萬,一個誰都不符合的數。而中位數6萬幾乎紋絲不動。這個離群值不需要刪除;它需要的是一種不讓單個值劫持全局的穩健概括方式。
一份極端薪資劫持了均值,卻幾乎動不了中位數。
切勿條件反射式地刪除離群值。在詐欺、故障偵測和罕見病的工作裡,離群值本身就是訊號——丟掉它們,等於把整個專案的意義都扔了。
又稱
另見