学习范式
无监督学习(unsupervised learning)
/ un-soo-per-VIZED LER-ning /
想象你把一大盒混在一起的纽扣倒在桌上,没有人告诉你该分成哪些类别,你却自己动手归拢起来——这些是圆的、红的,那些是方的、金属的。没有人给你标准答案;你只是看着看着,就找出了其中的结构。这就是无监督学习:计算机研究没有标签的数据,靠自己去发现里面隐藏的模式、分组或形状。
说得更准确些,无监督学习只用输入,每个例子上并不附带目标答案。两件经典的活儿是聚类(把例子分进天然的群组,比如买东西口味相近的顾客)和降维(把许多测量值浓缩成寥寥几个、却抓得住要点,让数据更易于观察和存储)。因为没有答案卡,它的成败只能间接判断——分出来的组看着合不合理、对后续任务有没有帮助——而不是靠一个简单的分数。
它之所以重要,是因为带标签的数据既贵又少,而原始的、无标签的数据却到处都是。无监督方法让你在还没有人贴过任何标签之前,就能探索一份新数据、发现异常、或先把信息压缩一番。但要诚实地说一句:没有答案卡,结果就可能含糊不清。不同方法会把同一份数据切成不同的组,而往往并不存在唯一可证明为正确的答案——到头来,还是得你这个人来判断,它找到的结构是否真有意义。
一家网店并没有「省钱党」或「奢侈型买家」这样的标签。它把每位顾客的购买记录喂进聚类算法,算法把他们分成几个天然的群体。营销团队再去解读这些群体并给它们起名——算法找出了聚类,意义则由人赋予。
聚类找出群组,含义由人来定。
「无监督」并不等于「不费人力」——你仍要选方法、调参数,还要判断找出的模式是否真实。而且这里没有唯一正确答案,两次合理的运行也可能彼此不合。
又称
另见