数据与特征
数据集(dataset)
/ DAY-tuh-set /
数据集就是为了让机器从中学习而收集起来的一堆例子——很像学生在真正考试前要研读的一摞往年试卷。每个例子是一行:一套房子连同它的面积、地段和成交价;一封被标注为垃圾邮件与否的邮件;一张照片连同它所描绘之物的名称。这些例子的整体集合,就是数据集。
再看仔细些,数据集通常是一张表。每一行是一个实例(一次观测),每一列是一个特征(feature)——也就是可度量的属性,比如建筑面积或像素亮度。在监督学习中,有一列特殊的列叫标签(label),即我们希望机器预测的答案。数据集也会以不那么整齐的形态出现:一个装满图片的文件夹、一堆文本文档、一串传感器读数。但归根结底,它们都可以归结为「例子」加上「描述这些例子的属性」。
为何重要:模型的好坏,至多只能和它见过的例子一样好。如果数据狭窄、陈旧或有偏,模型就会继承这些缺陷——它只能从被展示过的东西里去举一反三。从业者会极其在意一个数据集是怎样采集的、它代表了谁或代表了什么、又悄悄遗漏了什么,因为这些抉择会左右模型此后做的一切。更大的数据集并不自动等于更好的数据集;找对例子,比单纯堆数量更要紧。
一个垃圾邮件过滤器的数据集,也许是一张包含5万封邮件的表。每一行是一封邮件;各列存放词频、发件域名等特征;最后一列是标签——「垃圾」或「非垃圾」——由人工逐封分拣后填上。
把数据集看作一张表:行是例子,列是特征,其中一列是标签。
数据多不等于数据好。一个系统性地低估了某些群体或情形的数据集,会造就一个在那里悄悄失灵的模型——再聪明的算法,也无法把例子里根本不存在的信息补回来。
又称
另见