治理與災難性風險

AI 安全研究所(AI safety institute)

當新藥或新飛機出現時,政府不會只憑製造商一句「它很安全」就照單全收;他們會設立具備專業能力的公共機構去測試與檢查。AI 安全研究所就是先進 AI 的對應物:一個由政府支持的組織,任務是理解、量測並協助管理能力最強系統的風險。

具體而言,這些研究所通常會建立技術團隊,針對前沿模型評測其危險能力(例如,一個模型是否能實質協助某人製造武器或發動網路攻擊)、發展共用的測試標準與方法、進行紅隊演練,並向所屬政府提供建議。其中數個自 2023 年起陸續成立,尤以英國與美國為著,此後也有若干國家組成了類似機構,並開始跨國協調。關鍵在於:多數機構是評測者與標準制定者,而非監管者:它們往往負責測試與建議,但本身並不核發許可或禁止一個模型。

AI 安全研究所之所以重要,是因為它們讓治理的「公共那一側」擁有真正的技術肌肉,而不是把評測整個丟給打造模型的公司。但它們的權力與獨立性差異很大。有些擁有提前接觸模型的特殊權限;有些則仰賴自願合作。它們面對艱難的問題:要從業界搶來稀缺的人才、要取得足夠深的存取權限才能好好測試、要避免被它們所評估的公司「俘獲」,而且通過它們的測試只證明「被測到的部分」是安全的,並不保證在真實世界裡也安全。

在某實驗室釋出最新模型之前,一個國家級 AI 安全研究所獲得了提前存取權限,針對生物與網路誤用進行了結構化測試,發現了一項令人擔憂的能力,並予以通報,好讓該實驗室在上市前加上防護措施。

研究所讓政府擁有實作層面的技術能量,於是安全宣稱可以被「查核」,而不只是被「相信」。

多數 AI 安全研究所負責評測與建議;它們通常不是核發許可或禁止模型的單位。它們的獨立性與存取權限差異甚大,而且一份「健康證明」只涵蓋被測試的分布,並非每一種真實世界的用法。

又称
AISIAI safety institute