机器学习工程与系统

数据漂移与概念漂移(data and concept drift)

/ DAY-tuh and KON-sept drift /

漂移,是一个已部署的模型缓慢地、往往无声地变陈旧的方式——因为它训练时所依据的那个世界,已经往前走了。它有两种味道。数据漂移,指的是输入变了:模型见到的仍是同一类问题,可它被问及的那个群体却挪了位——一个在去年的购物者身上训练出来的模型,如今见到的是习惯不同、更年轻的一拨人。概念漂移则更深:输入与正确答案之间的关系本身变了——一场突如其来的经济冲击之后「正常」的消费模式,或是随着骗子翻新花样、「垃圾邮件」的定义。

一个能让人切身体会差别的法子:设想预测房价。数据漂移,是在售的房子变了(忽然公寓比从前多了许多)——规则照旧,输入的构成是新的。概念漂移,是规则变了(一项新政策让地段远比面积重要)——「一个好预测」的含义本身,已经挪了位。前者是「你看到的东西」变了;后者是「答案该是什么」变了。

为什么这很重要:漂移是「一个上线时表现出色的模型,随时间悄悄变差」最常见的单一原因,而它从不以错误的形式露面——预测照样源源不断地流出来,只是越来越不对了。一句实话是:漂移不是一个修一次就完的 bug,而是真实世界一种永久的状况;几乎每一个生产模型,最终都会退化。它没有根治之法,只有管理:监控着它,一旦它出现,就在新鲜数据上重训。模型是一张「流动世界」的快照,而世界不会停着不动。

一个标记欺诈交易的模型,本来用得好好的,直到骗子换了打法。输入(交易)表面上看仍旧正常——没有数据漂移的警报——可「什么让一笔交易算欺诈」却挪了位。这就是概念漂移:哪怕问题看上去一模一样,答案却变了。

概念漂移是阴险的那种——输入看着没事,可正确答案却悄悄变了。

漂移不是一个你能一劳永逸地工程掉的缺陷;它是任何一个面对变动世界的模型,默认的归宿。现实的目标,不是防住它,而是及早察觉它、再去重训——把模型维护当作一笔永久持续的成本,而非一次性的上线。

又称
data driftconcept driftdistribution shift数据漂移概念漂移