基礎——什麼是 AI 安全與為何重要

AI 安全與 AI 倫理之別(AI safety vs AI ethics)

有兩個社群都希望 AI 走向好的結果,但他們往往從不同的問題出發,把兩者混淆會造成許多混亂的爭論。AI 倫理(常與公平性、問責、負責任 AI 等工作重疊)問的是:AI 現在正如何影響人與社會,這公正嗎?它關注的核心包括偏見與歧視、透明度、隱私、對勞動的衝擊,以及權力掌握在誰手裡。而 AI 安全,在這裡所用的意義上,問的是:我們要怎麼讓系統可靠地做到「被意圖的事」、並避免大規模傷害,也包含來自未來更強系統的風險?

一個具體的對照會有幫助。從 AI 倫理的鏡片看一個招聘模型,會問它是否歧視某些群體、申請者能否對它的決定提出異議、以及它是否用人們同意過的資料訓練。從 AI 安全的鏡片看一個強大的通用系統,會問它是否在追求我們未曾意圖的目標、它能否被大規模誤用、我們能否糾正或關閉它、以及它在新輸入上的行為是否一如測試時。一個大致關乎正義與當下的傷害;另一個大致關乎控制、可靠性與尾端風險。

誠實的重點是:這是一條柔性的區分,而非一道牆,而且兩者彼此需要。它們共用方法(評測、紅隊、可解釋性),許多關切也彼此重疊;一個帶偏見的系統,既是倫理上的失敗,在技術意義上也是一次「意外」。雙方各有批評者有時指控對方在分散注意力,說「存在性風險的談論」轉移了對真實當下傷害的關注,或說「當下的傷害」與「未來的賭注」相比微不足道,但許多研究者認為這是一個假兩難,並橫跨兩邊工作。這些標籤的用處在於「察覺正在被問的是哪個問題」,而不是用來選邊站隊。

拿一個人臉辨識系統來說。倫理的問題是:它是否對某些人口群體更常誤判,以及這在今天如何傷害真實的人。安全的問題是:這個系統在訓練分布之外是否行為可靠、能否抵抗對抗式操弄。對同一個產品來說兩者都重要;它們只是在問關於它的不同事情。

同一個系統,兩個問題:當下的正義,相對於可靠、可控的行為。

把安全與倫理當成對手,是一種常見且無益的框架。兩者高度重疊、共用工具,而許多嚴肅的研究者拒絕這種想法:在意未來風險就等於忽視當下傷害,或反過來。

又称
safety vs ethicssafety vs fairnessAI 安全 vs AI 倫理