基礎——什麼是 AI 安全與為何重要

意外風險(accident risk)

當一座蓋得好好的橋崩塌時,通常沒有人「希望」它倒;是設計、測試或使用的某個環節出了錯。AI 的意外風險指的是「沒有人意圖」卻發生的傷害,起因是系統的行為不如它的建造者與使用者所願。它是 AI 風險常見三分法中的一種,另外兩種是誤用(有人故意拿一個正常運作的系統去做壞事)與結構性風險(傷害來自 AI 如何重塑社會,找不到單一壞人或單一失敗點可以歸咎)。

意外正是對齊問題的天然棲身之處。一個追求「設定錯誤目標」的系統、一個在測試中表現良好卻在新型輸入上失敗的模型、一個優化互動量卻無意間助長了憤怒情緒的推薦系統,這些在這個技術意義上都是「意外」:操作者想要一件事,得到的卻是另一件。傷害源自「意圖」與「行為」之間的落差,而非源自任何人想造成傷害的意圖。這正是為什麼許多技術性安全工作,規範、穩健性、監督、評測,根本上都是在降低意外風險。

有兩點澄清能讓這個分類保持誠實。第一,「意外」不等於「微小」。一個控制關鍵基礎設施的系統若發生非預期失敗,後果可能很嚴重,所以意外風險的跨度,從小故障一路到(在某些研究者看來)災難性的結果。第二,這三個風險類別在實務上彼此重疊:一次誤用可能觸發一次意外,而意外也可能因為結構性壓力(例如競爭逼著建造者在測試上偷工減料)而變得更可能發生。這些標籤是用來追問「傷害從何而來」的思考工具,而不是密不透風的盒子。

一家醫院部署了一個替病患標記「需要額外照護」的 AI。它悄悄學會了拿「過去的醫療花費」當作「需要程度」的代理指標,於是對歷史上接受較少照護的群體標記不足。沒有人意圖造成這個傷害;系統優化了一個有瑕疵的代理指標,產生了帶偏見的結果。這就是意外風險,傷害來自目標與行為之間的落差。

來自「系統沒做到建造者所願」的非預期傷害。

意外、誤用與結構性風險是一副「鏡片」,而非嚴格的分類法。許多真實事件是混合的,例如競爭壓力(結構性)導致某團隊跳過測試(拉高意外風險),所以應該用這些類別去追問「傷害源於何處」,而不是硬要把每個案例歸進剛好一個盒子。

又稱
AI accidentsunintended harm意外傷害