算法偏见(algorithmic bias)
/ AL-guh-rith-mik BY-us /
算法偏见,指的是一套计算机系统对某些人群的对待,系统性地比对其他人差——并不是因为有谁写下了一条「要不公平」的规则,而是因为它学到的模式从一开始就是歪的。设想一个招聘工具,用某公司过去十年的录用记录训练而成。如果这家公司过去主要录用男性,工具就会悄悄学到「看起来像男的」与「是好员工」相关——于是开始给那些提到「女子学院」或「女子象棋俱乐部」的简历扣分。没有人把这种偏见敲进系统;它是顺着喂给机器的历史悄悄渗进来的。
更准确地说,算法偏见是指一套系统在不同群体之间——以种族、性别、年龄、残障等区分——表现或决策上出现可被度量的差异,而这种差异是没有正当理由的、有害的,或两者皆是。它可能来自带偏的训练数据,来自一个暗中编码了偏见的标签(例如拿「谁被逮捕」来替代「谁犯了罪」),来自充当受保护特征替身的特征(用邮政编码替代种族),或来自优化一个完全无视公平的目标。
它为何重要:这些系统如今正帮着决定谁能拿到贷款、谁能获得面试、谁会被转诊、谁会被判更长的刑期——其规模与速度是任何人类委员会都无法企及的。一个有偏见的模型,能把同一个不公平的决定复制上百万次;而因为它披着数学的外衣,人们往往比面对一个明显带偏见的人时更信任它。诚实的结论是:算法并不会自动中立;除非有人刻意去度量并加以纠正,否则它会把世界的种种不平等照单全收。
2018年,一家大型零售商废弃了一套实验性的简历筛选工具,因为工程师发现它会给任何含有「women's(女子的)」一词的申请扣分(比如「女子足球队队长」)。这个模型是用十年来以男性为主的简历训练出来的,于是悄悄得出了「男性候选人更可取」的结论。
偏见藏在历史数据里,而非任何手写的规则中——要刻意去审计,才抓得出来。
「数学是客观的,所以它不可能有偏见」是这里最危险的迷思。数学只会忠实地再现数据里的东西,而历史数据满是人类的不公。偏见是默认结果,而非罕见的故障——中立才是你必须努力去争取的东西。