机器学习

监督学习(supervised learning)

监督学习是机器照着范例学习的方式,而且手里握着一份「标准答案」。你给它成千上万个例子,每个输入都已经配好了正确的输出——一张标着「猫」的照片、一封标为「垃圾邮件」的邮件——它便慢慢摸索出连接二者的规律。这就像学生背记忆卡片:正面是问题,背面是答案,反复练习,直到规则烂熟于心。

其全部意义在于举一反三。一旦训练完成,机器就该能应对从未见过的输入——一张全新的照片、明天才到的邮件——并依然给出正确答案。这类任务分两种口味:分类,输出是一个类别(猫还是狗、是不是垃圾邮件);回归,输出是一个数值(一套房子的价格、明天的气温)。

棘手之处——而且分量很重——在于那些标签。每个例子都必须标注上正确答案,通常得靠人来做,既慢又费钱。而且机器只学得到标签所教的东西:喂给它有偏差或马虎的例子,它就会忠实地把这些毛病复制出来。「监督」并不是说有人在机器干活时盯着它看;而是说在训练时,有一位「老师」提供了答案。

给它看 1 万张分别标着「猫」或「狗」的照片;之后它便能自己为一张新照片贴标签。

分类:标签教会它,随后它把所学推广到未见过的样本。

这个名称可追溯到机器学习的早期年代:那些带标签的例子充当「监督者」或老师,纠正模型的猜测。它的对立面是无监督学习——没有标准答案,必须自己在数据中找出结构。

又称
labeled learninglearning from labeled data监督式学习有监督学习監督學習