机器学习
特征(feature)
/ FEE-chur /
特征,是描述某个你想让机器学习的事物的、一条可以度量的信息。如果你要预测一套房子的价格,特征可能是它的建筑面积、卧室数量、建成年份,以及离最近的火车站有多远。每个特征是表格里的一列,每套房子是一行。机器从来没见过房子本身,它看到的只是这一摞代替房子的数字和类别。
选对特征,往往比选对算法更要紧。一个弱特征,是指它和答案几乎没什么关系——大门的颜色,几乎告诉不了你关于房价的任何事。强特征则带着真正的信号。有时最有用的特征并非直接测量得来,而是从原始数据里造出来的:从出生日期可以算出年龄,从时间戳可以抽出是星期几。这门设计更好特征的手艺,就叫特征工程。
要诚实地看待它的局限。模型只能从你给它的特征里学习——如果一个关键事实根本没出现在那些列中,再巧妙的数学也变不出它来。特征还可能悄悄夹带偏见:如果某个特征实际上是种族、性别或邮政编码的替身,模型就可能在无人有意的情况下产生歧视。特征是机器观察世界所用的那副镜片,镜片若狭窄或扭曲,看到的世界也就狭窄或扭曲。
要预测一笔贷款能否还上,有用的特征可能是收入、贷款额度,以及过去账单的还款是否守信。申请人的姓名是个没用的特征;而他们的负债收入比——由另外两个特征相除造出来——往往是个很强的特征。
有些特征带着信号,有些什么也没有,还有些最好由别的特征组合而成。
别把特征(模型读取的输入)和标签(它努力预测的答案)搞混。同一个事实在不同任务里可以扮演不同角色:顾客的年龄在预测消费时是输入,但如果你想从照片里猜出年龄,它就成了标签。
又称
另见