演算法偏見(algorithmic bias)
/ AL-guh-rith-mik BY-us /
演算法偏見,指的是一套電腦系統對某些人群的對待,系統性地比對其他人差——並不是因為有誰寫下了一條「要不公平」的規則,而是因為它學到的模式從一開始就是歪的。設想一個招聘工具,用某公司過去十年的錄用記錄訓練而成。如果這家公司過去主要錄用男性,工具就會悄悄學到「看起來像男的」與「是好員工」相關——於是開始給那些提到「女子學院」或「女子象棋俱樂部」的履歷扣分。沒有人把這種偏見敲進系統;它是順著餵給機器的歷史悄悄滲進來的。
更準確地說,演算法偏見是指一套系統在不同群體之間——以種族、性別、年齡、障礙等區分——表現或決策上出現可被度量的差異,而這種差異是沒有正當理由的、有害的,或兩者皆是。它可能來自帶偏的訓練資料,來自一個暗中編碼了偏見的標籤(例如拿「誰被逮捕」來替代「誰犯了罪」),來自充當受保護特徵替身的特徵(用郵遞區號替代種族),或來自最佳化一個完全無視公平的目標。
它為何重要:這些系統如今正幫著決定誰能拿到貸款、誰能獲得面試、誰會被轉診、誰會被判更長的刑期——其規模與速度是任何人類委員會都無法企及的。一個有偏見的模型,能把同一個不公平的決定複製上百萬次;而因為它披著數學的外衣,人們往往比面對一個明顯帶偏見的人時更信任它。誠實的結論是:演算法並不會自動中立;除非有人刻意去度量並加以糾正,否則它會把世界的種種不平等照單全收。
2018年,一家大型零售商廢棄了一套實驗性的履歷篩選工具,因為工程師發現它會給任何含有「women's(女子的)」一詞的申請扣分(比如「女子足球隊隊長」)。這個模型是用十年來以男性為主的履歷訓練出來的,於是悄悄得出了「男性候選人更可取」的結論。
偏見藏在歷史資料裡,而非任何手寫的規則中——要刻意去稽核,才抓得出來。
「數學是客觀的,所以它不可能有偏見」是這裡最危險的迷思。數學只會忠實地再現資料裡的東西,而歷史資料滿是人類的不公。偏見是預設結果,而非罕見的故障——中立才是你必須努力去爭取的東西。