数据与特征

类别特征与数值特征(categorical vs numerical features)

/ kat-uh-GOR-ih-kul vurs noo-MAIR-ih-kul FEE-cherz /

在建模之前,你得先弄清每一列到底是哪一类东西——因为数字和标签需要用不同的方式处理。第一道大分岔,就是类别型与数值型。类别特征指出某物属于哪一组(眼睛颜色、国家、血型);数值特征则度量一个你可以对其做算术的量(身高、温度、价格)。

在每一类里还有有用的细分。类别特征可以是名义型(没有天然次序——颜色、城市),也可以是有序型(有意义的次序但间距不固定——小/中/大,或1到5星的评分)。数值特征可以是离散的(整数计数——子女数),也可以是连续的(某范围内的任意取值——体重、时间)。判断是否数值型的试金石是:把两个值相加或取平均,说得通吗?两个温度取平均是有意义的;两个邮政编码取平均却是胡言乱语,这就告诉你:邮政编码其实是类别型,尽管它看起来像个数字。

为何重要:类型决定了处理方式。数值特征可以缩放;类别特征则要编码(名义型用独热,有序型用有序整数)。把一个特征归错类——把邮编当数字、或把有序评分当作无序类别——会悄悄给模型喂进关于「距离」和「次序」的错误假设,由此得到的模型可能会以一种隐蔽而顽固的方式出错。

在一份问卷的某一行里:年龄34(数值型、连续),宠物数2(数值型、离散),最喜欢的颜色「蓝」(类别型、名义),五点量表上的满意度「非常高」(类别型、有序),还有邮编90210——纸面上是个数字,实则是类别型,因为给邮编取平均毫无意义。

五个列,四种类型组合——还有一个暗地里是类别的数字。

陷阱在于那些「看着是数字、其实不是」的列:邮编、商品ID、电话号码、当作标签用的年份。如果把两个值取平均毫无意义,那无论它长得多像数字,都该当类别特征来对待。

又称
feature typesdiscrete vs continuous类别型与数值型特征类别特征數值特徵categorical featuresnumerical features