AI安全(AI safety)
/ AY-EYE SAYF-tee /
AI安全,是一項寬泛的努力:讓AI系統行為可靠、避免造成傷害——把它們造得即便強大、有能力、又在真實世界裡行動,也不會因失誤、濫用,或以意料之外的方式追求目標而釀成損害。若把造AI比作造越來越快的汽車,那麼AI安全就涵蓋了從剎車、安全帶到碰撞測試與交通規則的一切:一門「別被自己造的東西傷到」的學問。
它是一把傘,罩著時間尺度和關切都迥然不同的諸多議題。近期而具體的:模型會信心十足地編造、會洩露隱私數據、會給出危險指示、會吸收偏見,或能被「越獄」誘導去作惡——這些問題此刻就存在,正造成真實的傷害。長遠而更具思辨色彩的:確保未來那些有能力得多的系統,仍然可控、仍與人類意圖對齊——對齊問題、以及工具性趨同之類的論證,就棲身於此。兩端都屬於安全的範疇;至於該如何在兩者間分配注意力,嚴肅的人各執一詞。
有兩種誠實的框定很有幫助。其一,安全並不與能力或進步對立——它恰恰是你「既保住好處、又不出事故」的途徑,正如航空安全成全了大眾航空旅行,而非阻攔它。其二,對炒作與輕蔑都要提防:「AI會把我們全殺光」與「AI安全不過是用來拖慢對手的幌子」,都是信心十足的過頭話。腳踏實地的看法是:AI系統是強大的工具,帶著真實而多樣的失敗模式,而減少這些失敗——無論現存還是潛在——是尋常而必要的工程與治理,不是什麼花邊戲。
在發佈一個模型之前,團隊會做「紅隊演練」:讓人故意去誘使它產出有害指示、洩露訓練數據,或被一段藏在它所讀網頁裡的惡意提示騙到。每一次得手的攻擊,都是一個待修的安全缺陷——於是加上拒答、過濾器或各種限制——這就跟軟體上線前做安全測試一模一樣。
紅隊演練:在使用者(或攻擊者)之前,先攻擊你自己的模型,把失敗找出來。
AI安全不是一場辯論,而是許多場:今天的數據洩露、偏見與越獄,跟假想中的超級智慧風險是兩碼事。把它們混為一談,只會讓各方互相把對方漫畫化。兩者都值得關注,但它們需要不同的工具,不該被混同。