基礎——什麼是 AI 安全與為何重要

誤用風險(misuse risk)

一把菜刀不論是在切菜還是被拿去傷人,運作方式都完全如其設計;那裡的危險不是故障,而是人的意圖。AI 的誤用風險指的是:系統「依預期正常運作」,卻落在一個想造成傷害的人手裡所帶來的傷害。系統沒壞、也沒失準;問題在於「誰在用它、為什麼用」。這是標準三類風險中的第二類,與意外風險(非預期失敗)和結構性風險(來自系統性效應的傷害)並列。

從誤用的角度看,有能力的 AI 之所以令人擔憂,是因為它降低了「大規模做壞事」所需的成本與技術門檻。一個能寫出有說服力文字的模型,可以被用來大量散布假訊息或量身打造詐騙;一個能寫程式的模型,可以幫忙製作惡意軟體;一個具備深厚科學知識的模型,在最壞情況下,可能降低製造危險武器的門檻。傷害完全是由人類所意圖的,但 AI 扮演了「力量倍增器」的角色,把過去需要稀有專業或龐大團隊才能做的事,變得更便宜、更容易取得。

誤用正是許多實務安全工程瞄準的對象:拒答訓練,讓模型回絕明顯有害的請求;紅隊演練與危險能力評測,去找出模型可能被誘導去做什麼;以及對濫用的監控。誠實的但書是:這些防禦並不完美,也有爭議。越獄與提示注入經常繞過防護,而且存在真正的辯論,尤其圍繞「開放權重」模型,介於「廣泛存取的好處」與「一旦有能力的模型被廣泛取得、就難以防止誤用」之間。

一個詐騙者用一個運作完全正常的語言模型,產生了數千封量身打造的釣魚郵件,每一封都流暢又令人信服。模型做的剛好是它被造出來要做的事,把字寫好;傷害完全來自使用者的意圖。這是誤用,不是故障,這也是為什麼光靠修模型本身無法完全解決它。

來自「系統依預期正常運作」的傷害,由使用者的意圖所驅動。

誤用不同於失準。一個失準的系統會去做它操作者「不想要」的事;一個被誤用的系統做的剛好是操作者「想要」的事,問題出在操作者身上。許多防護措施瞄準的是誤用,但越獄顯示它們遠非萬無一失。

又称
AI misusemalicious use惡意使用