機器學習

特徵(feature)

/ FEE-chur /

特徵,是描述某個你想讓機器學習的事物的、一條可以度量的資訊。如果你要預測一套房子的價格,特徵可能是它的建築面積、臥室數量、建成年份,以及離最近的火車站有多遠。每個特徵是表格裡的一欄,每套房子是一列。機器從來沒見過房子本身,它看到的只是這一疊代替房子的數字和類別。

選對特徵,往往比選對演算法更要緊。一個弱特徵,是指它和答案幾乎沒什麼關係——大門的顏色,幾乎告訴不了你關於房價的任何事。強特徵則帶著真正的訊號。有時最有用的特徵並非直接測量得來,而是從原始資料裡造出來的:從出生日期可以算出年齡,從時間戳可以抽出是星期幾。這門設計更好特徵的手藝,就叫特徵工程。

要誠實地看待它的侷限。模型只能從你給它的特徵裡學習——如果一個關鍵事實根本沒出現在那些欄中,再巧妙的數學也變不出它來。特徵還可能悄悄夾帶偏見:如果某個特徵實際上是種族、性別或郵遞區號的替身,模型就可能在無人有意的情況下產生歧視。特徵是機器觀察世界所用的那副鏡片,鏡片若狹窄或扭曲,看到的世界也就狹窄或扭曲。

要預測一筆貸款能否還上,有用的特徵可能是收入、貸款額度,以及過去帳單的還款是否守信。申請人的姓名是個沒用的特徵;而他們的負債收入比——由另外兩個特徵相除造出來——往往是個很強的特徵。

有些特徵帶著訊號,有些什麼也沒有,還有些最好由別的特徵組合而成。

別把特徵(模型讀取的輸入)和標籤(它努力預測的答案)搞混。同一個事實在不同任務裡可以扮演不同角色:顧客的年齡在預測消費時是輸入,但如果你想從照片裡猜出年齡,它就成了標籤。

又稱
attributeinput variablepredictor特征特徵属性输入变量