数据与特征
以数据为中心的AI(data-centric AI)
/ DAY-tuh-SEN-trik AY-EYE /
多年以来,改进一个AI系统的办法,是去摆弄模型——试试更花哨的架构、多调几个旋钮、多加几层——而把数据集当作一个你只能将就的、固定不变的东西。以数据为中心的AI颠倒了这个优先次序。它让模型保持不动,转而系统性地去改进数据:修正错误的标签、补上缺口、去除重复、为模型搞砸的那些情形添加例子。它的口号是:更好的数据,常常胜过更好的模型。
具体说来,一套以数据为中心的工作流,会去寻找模型在哪里失败,把这些失败追溯回数据,再去修数据:纠正标错的例子、让标注规范保持一致、为被低估的情形采集更多数据,并像衡量模型准确率那样审慎地衡量数据质量。这个说法由吴恩达(Andrew Ng)在2021年前后推广开来,作为对这一领域长期沉迷于「更大更聪明的模型」的一个有意为之的制衡。
为何重要:在许多真实项目里,数据集比模型更杂乱、也更具影响力,却得到了远更少的关注。清洗标签、修补覆盖缺口,往往能比更换算法带来更大、更可靠的提升——在数据有限时尤其如此。一个诚实的告诫是:这是一种侧重点的转移,而非灵丹妙药——数据和模型都重要,正确的做法通常是去改进当下那个最薄弱的环节,而不是把其中之一奉为王者。
一个缺陷检测模型卡在了76%。团队没有去尝试新架构,而是审查了数据,发现检验员们对「划痕」的认定标准并不一致。他们重写了标注规范、一致地重新标注,准确率随即跃升到了90%——而模型一模一样。问题的解药,自始至终都在数据里。
同一个模型,修好标签:14个百分点的提升,任何架构都买不来。
以数据为中心的AI是对精力分配的一次再平衡,而非宣称模型无关紧要。实践中,你要改进的是当下最薄弱的那一环——而出人意料地,那一环常常正是数据。
又称
另见