數據與特徵

離群值(outlier)

/ OWT-ly-er /

離群值是一個遠離大眾的資料點——就是那個讓你忍不住再看一眼的值。在一個人人考60到90分的班裡,單單一個5分就是離群值。它也許是一個真實的極端案例,也許是一處錯誤;把這兩者分辨開來,正是這項工作的大半。

離群值出自兩個截然不同的來源。有些是錯誤:手滑打錯的數字(把一個人的體重寫成1500公斤)、壞掉的感測器、單位搞混。另一些則真實但罕見:一筆確實巨額的交易、一位的確不尋常的病人。關鍵在於,你無法僅憑那個數字就判斷它屬於哪一種——你必須去調查。從統計上看,離群值常被識別為「離均值許多個標準差」的值,或落在資料主體之外很遠處,但被標記出來只是一份「請你去看一看」的邀請,而非一道「自動刪除」的判決。

為何重要:寥寥幾個極端點就能拉偏一個平均值、扭曲一條擬合的直線,並主導基於尺度的預處理,結果模型變得只盯著那些怪胎、而非典型情形。但盲目刪除離群值是危險的——在詐欺偵測或罕見病篩查裡,離群值恰恰正是你要找的東西。誠實的做法是:弄清每個離群值的成因,再做選擇:修正它、保留它、給它封頂,或為它單獨建模。這裡沒有放之四海皆準的規則。

一個團隊的平均薪資大約是6萬美元,直到把創辦人那500萬的數字算進來——這下「平均值」一躍成了55萬,一個誰都不符合的數。而中位數6萬幾乎紋絲不動。這個離群值不需要刪除;它需要的是一種不讓單個值劫持全局的穩健概括方式。

一份極端薪資劫持了均值,卻幾乎動不了中位數。

切勿條件反射式地刪除離群值。在詐欺、故障偵測和罕見病的工作裡,離群值本身就是訊號——丟掉它們,等於把整個專案的意義都扔了。

又稱
anomalyoutlying value离群点异常值離群值異常值