評測、紅隊與穩健性

安全論證

那些處理重大危害的產業——核電廠、飛機、藥品——往往被要求提出一份「安全論證(safety case)」:一份書面的、結構化的、有證據支撐的論證,說明為什麼某個特定系統「夠安全」可以運作,好讓監理機關與獨立專家加以審視。這個構想如今正被調整用於 AI:開發者不再只是指著幾項通過的測試,而是組織出一套明確的論證,說明為什麼部署某個特定模型是「可接受地安全」。

安全論證不只是一堆評測結果。它陳述一項主張(「這個模型不會構成不可接受的 X 風險」),攤開那套「若成立則該主張為真」的推理,並為每一步提供證據——能力與安全評測、紅隊測試結果、部署保障、監控計畫——同時誠實交代其假設與缺口。關鍵在於,它必須說明「為什麼這些證據足夠」:例如,為什麼通過這幾項特定測試,就足以讓人對模型實際會面對的「未受測情境」有信心。

安全論證正是那門認真看待「通過評測」與「是安全的」兩者之差別的學問。一項測試上的分數是一塊證據;而安全是整個「已部署系統」在真實世界中的性質,這包括了攻擊者、分布偏移,以及我們可能沒能引出的能力。一份好的安全論證會把「從證據到結論」的這一躍講明、講得可被辯駁,好讓薄弱的環節能被挑戰。它是前沿 AI 一項正在浮現的實務,而非成熟或標準化的做法,而且一份安全論證仍可能是錯的——但把它寫出來,會逼著推理攤到檯面上,讓它能被檢驗。

開發者不再只說「模型通過了我們的危害測試」,而是記錄下來:這是我們擔心的風險,這是為什麼我們的評測與保障措施合起來能排除它,這是我們所倚賴的假設——一套外部審查者能加以攻擊的結構化論證。

安全論證從證據一路論證到「夠安全」這個結論,並把這套論證「可能在哪裡崩掉」明白攤開。

通過評測是安全論證裡的「證據」,並不等於「是安全的」:論證必須說明為什麼受測案例足以讓人對未受測的真實情況有信心。AI 的安全論證是一項正在浮現、尚未定型的實務,仍可能出錯。

又称
safety case結構化安全論證安全案例