数据与特征
离群点(outlier)
/ OWT-ly-er /
离群点是一个远离大众的数据点——就是那个让你忍不住再看一眼的值。在一个人人考60到90分的班里,单单一个5分就是离群点。它也许是一个真实的极端案例,也许是一处错误;把这两者分辨开来,正是这项工作的大半。
离群点出自两个截然不同的来源。有些是错误:手滑打错的数字(把一个人的体重写成1500公斤)、坏掉的传感器、单位搞混。另一些则真实但罕见:一笔确实巨额的交易、一位的确不寻常的病人。关键在于,你无法仅凭那个数字就判断它属于哪一种——你必须去调查。从统计上看,离群点常被识别为「离均值许多个标准差」的值,或落在数据主体之外很远处,但被标记出来只是一份「请你去看一看」的邀请,而非一道「自动删除」的判决。
为何重要:寥寥几个极端点就能拉偏一个平均值、扭曲一条拟合的直线,并主导基于尺度的预处理,结果模型变得只盯着那些怪胎、而非典型情形。但盲目删除离群点是危险的——在欺诈检测或罕见病筛查里,离群点恰恰正是你要找的东西。诚实的做法是:弄清每个离群点的成因,再做选择:修正它、保留它、给它封顶,或为它单独建模。这里没有放之四海皆准的规则。
一个团队的平均薪资大约是6万美元,直到把创始人那500万的数字算进来——这下「平均值」一跃成了55万,一个谁都不符合的数。而中位数6万几乎纹丝不动。这个离群点不需要删除;它需要的是一种不让单个值劫持全局的稳健概括方式。
一份极端薪资劫持了均值,却几乎动不了中位数。
切勿条件反射式地删除离群点。在欺诈、故障检测和罕见病的工作里,离群点本身就是信号——丢掉它们,等于把整个项目的意义都扔了。
又称
另见