机器学习

标签(label)

/ LAY-bul /

标签,是贴在一个例子上的正确答案——也就是你想让机器学会去预测的那个东西。如果你给程序看成千上万张照片,并告诉它哪些里头有猫,那么钉在每张照片上的「猫」或「无猫」就是它的标签。它是记忆卡片的背面:输入是问题,标签是机器学习时用来对照、给自己打分的答案。

标签有不同的形态。它可以是一个类别,比如「垃圾邮件」或「非垃圾邮件」(用于分类);也可以是一个数值,比如明天的气温(用于回归)。标签从哪儿来,关系极大。大多数标签是人一个一个标出来的——一项又慢又费钱的活,叫数据标注。也有些标签由世界本身免费送上门来:顾客究竟点没点那个链接、病人有没有康复。这些天然的结果,往往是所有标签中最可信的。

诚实地说,模型的上限就是标签的质量。如果标签本身错了、前后不一致,或带着偏见,机器就会忠实地把这些错误学进去——垃圾进,垃圾出。对同一个例子,两个人甚至可能对正确标签争执不下(那条评论是正面的,还是只是在反讽?),而这种与生俱来的分歧,给任何模型所能达到的准确度都设了一个天花板。许多任务根本没有标签——这正是无监督学习所要应对的局面。

一个团队想从 X 光片里检出肿瘤。放射科医生逐一审阅 5 万张片子,给每张标上「有肿瘤」或「正常」。这些标记就是标签。当两位医生对一张模棱两可的片子各执一词时,那一个含糊的标签,就悄悄限定了最终模型能好到什么程度。

标签是标准答案——而人对标签的分歧,给模型的准确度封了顶。

「标签」通常意味着监督学习——每个例子都附带答案。许多 AI 项目里最贵的部分往往不是算力,而是费心费力地产出准确标签的人工。

又称
targetground truthoutput variable标签標籤目标真值