公平、伦理与社会

数据集偏差(dataset bias)

/ DAY-tuh-set BY-us /

数据集偏差,是当你用来训练模型的例子无法忠实代表模型将真正面对的世界时,悄悄渗进来的那种毛病。一个经典的警示来自真实故事:二战时,分析人员查看返航的轰炸机,看到弹孔集中在机翼上,差点就去加固机翼——直到一位统计学家指出,他们看到的只是那些幸存下来的飞机。被击中引擎的,根本飞不回来。他们的数据恰恰缺了最要紧的那些情况。这就是数据集偏差的精髓:在任何算法开始学习之前,那幅图景就已经是歪的了。

它有许多变体。抽样偏差:你的数据过度代表了某些人,又过少代表了另一些人(一个主要用美式口音训练的语音助手)。历史偏差:数据如实记录了一个本就不公的世界(过去的招聘记录映照着过去的歧视)。测量偏差:你记录下来的东西,是你真正在乎之物的一个有缺陷的替身(用「逮捕」来衡量「犯罪」)。标注偏差:给数据打标签的人,带进了他们自己的假设。每一种情形里,数据都在「撒谎」——并非出于恶意,而是出于遗漏或扭曲。

它为何重要:几乎每一次著名的AI失败,追根溯源都是数据集偏差,而非代码里某个精巧的bug。模型是其训练数据的一面镜子;如果镜子是变形的,再多的数学打磨也扶不正那个倒影。一个令人不安却诚实的要点是:你通常无法事后靠调算法来修复数据集偏差——你必须回头去修正你收集了什么、向谁收集、又是怎么测量的。在这里,「垃圾进、垃圾出」不是一句陈词滥调,而是核心的铁律。

一个皮肤癌分类器在实验室里达到了惊人的准确率,到了临床却屡屡失手。调查者发现,在它的训练图像里,许多恶性病灶旁边恰好放了一把用来标尺寸的尺子。模型其实部分地学成了「有尺子=癌症」——这是数据集的一个性质,而非皮肤的性质。

模型学到的,是数据收集方式中一个偶然的怪癖——而非任何人本意中的那个医学信号。

一个模型,在「同一批带偏数据」中划出的留出测试集上得分很高,到了真实世界里仍可能惨败——因为测试集继承了同样的盲点。基准测试上的高准确率,并不能证明公平,也不能证明可用;它可能只是说明:偏差是一以贯之的。

又称
data biassampling bias数据偏差样本偏差資料偏差