數據與特徵

類別特徵與數值特徵(categorical vs numerical features)

/ kat-uh-GOR-ih-kul vurs noo-MAIR-ih-kul FEE-cherz /

在建模之前,你得先弄清每一欄到底是哪一類東西——因為數字和標籤需要用不同的方式處理。第一道大分岔,就是類別型與數值型。類別特徵指出某物屬於哪一組(眼睛顏色、國家、血型);數值特徵則度量一個你可以對其做算術的量(身高、溫度、價格)。

在每一類裡還有有用的細分。類別特徵可以是名義型(沒有天然次序——顏色、城市),也可以是有序型(有意義的次序但間距不固定——小/中/大,或1到5星的評分)。數值特徵可以是離散的(整數計數——子女數),也可以是連續的(某範圍內的任意取值——體重、時間)。判斷是否數值型的試金石是:把兩個值相加或取平均,說得通嗎?兩個溫度取平均是有意義的;兩個郵遞區號取平均卻是胡言亂語,這就告訴你:郵遞區號其實是類別型,儘管它看起來像個數字。

為何重要:類型決定了處理方式。數值特徵可以縮放;類別特徵則要編碼(名義型用獨熱,有序型用有序整數)。把一個特徵歸錯類——把郵遞區號當數字、或把有序評分當作無序類別——會悄悄給模型餵進關於「距離」和「次序」的錯誤假設,由此得到的模型可能會以一種隱蔽而頑固的方式出錯。

在一份問卷的某一列裡:年齡34(數值型、連續),寵物數2(數值型、離散),最喜歡的顏色「藍」(類別型、名義),五點量表上的滿意度「非常高」(類別型、有序),還有郵遞區號90210——紙面上是個數字,實則是類別型,因為給郵遞區號取平均毫無意義。

五個欄,四種類型組合——還有一個暗地裡是類別的數字。

陷阱在於那些「看著是數字、其實不是」的欄:郵遞區號、商品ID、電話號碼、當作標籤用的年份。如果把兩個值取平均毫無意義,那無論它長得多像數字,都該當類別特徵來對待。

又稱
feature typesdiscrete vs continuous类别型与数值型特征类别特征數值特徵categorical featuresnumerical features