基礎——什麼是 AI 安全與為何重要

AI 安全(AI safety)

想想我們對待任何強大科技的方式。汽車要配安全帶、做撞擊測試;藥物要做臨床試驗;橋樑要留安全餘量。AI 安全就是把同樣的直覺用在人工智慧上:這是一個試圖讓 AI 系統可靠運作、避免造成嚴重傷害的研究領域,尤其是在這些系統能力越來越強、被交付越來越多責任時。它與其說是單一技術,不如說是一個我們不斷追問的問題:我們要怎麼讓強大的 AI 去做我們真正想要的事,而不出現惡劣的意外?

具體來說,AI 安全涵蓋一系列工作。有些是技術性的:在模型發布前測試它是否有危險行為、開發工具去檢視模型學到了什麼、以及設計能讓模型更誠實、更不容易被騙的訓練方法。有些則關乎制度與機構:決定誰可以建造最強大的模型、如何評測它們、以及評測不通過時該怎麼辦。一個有用的心理區分,是把今天已經看得到的問題(聊天機器人給出危險指示、模型自信地捏造事實),和研究者擔心未來更強系統可能出現的問題分開來看。

誠實地說,AI 安全是一個真實但有爭議的領域。研究者普遍同意現有系統已經造成真實傷害,而更強的系統會抬高風險的賭注,但他們對未來風險有多嚴重、多快會到來、哪些方法有用,意見分歧很大。有些人強調近期、可量測的傷害;有些人強調雖屬推測但衝擊極大的失敗模式。AI 安全是涵蓋這一切的大傘,而其中好的工作通常會明確說清楚自己在處理哪一個問題,而不是只是空泛地揮舞「風險」二字。

在發布新模型之前,實驗室會讓它通過一連串測試:它能不能被誘導去給出製造武器的逐步指示、它會不會把自己複製到其他機器上、它會不會為了完成任務而對使用者說謊?這些檢查,以及模型沒通過時該怎麼辦的決定,就是實務上的 AI 安全。

實務上的 AI 安全橫跨技術測試,以及圍繞它的制度決策。

AI 安全常被與 AI 倫理或公平性混淆。兩者有重疊但不相同:倫理關注的是 AI 今天如何影響人與社會,而安全關注的是讓系統依預期運作、不造成大規模傷害,也包含來自未來更強系統的風險。

又稱
AI safety research人工智慧安全