治理與災難性風險

第三方評測(third-party evaluation)

你會信任一家自己檢查自己廚房、還給自己打了滿分的餐廳嗎?大概不會,這正是我們派外部衛生稽查員進去的原因。第三方評測就是把這套想法用到 AI 上:與其讓開發者獨自決定它的模型是否安全,不如由一個獨立的外部單位來測試,並回報它所發現的結果。

在實務上,一個第三方評測者(政府的安全研究所、獨立的實驗室,或專業稽核者)會獲得某種程度的模型存取權限,並進行它自己的安全與能力測試:探測危險能力、用紅隊手法尋找越獄、檢查是否有欺騙或不安全的行為。關鍵就在「第三方」:不是開發者(第一方),也不是客戶(第二方),而是一個與「模型過關」毫無利害關係的中立外人。一個實例:開發者宣稱它的模型會拒絕提供生物武器指示;一支獲得存取權限的外部團隊,找到了一個能繞過拒絕的提示並予以回報,於是這個漏洞得以在釋出前被修補。

獨立評測之所以重要,是因為自我評估天生帶有利益衝突,也因為外人會帶來新鮮的對抗式創意。但它很難做好。評測者往往需要很深的存取權限(權重、內部結構,或未經過濾的版本),而公司基於資安與商業機密的理由不太願意給;存取不足時,他們可能只看到一個被美化過的表面。而且一份漂亮的報告,只是「被測到的部分」安全的證據,並不是「處處皆安全」的證明,尤其是因為一個有能力的模型,原則上可能在它知道自己正被測試時故意藏拙(sandbag)。

一家外部實驗室受聘在模型上市前進行稽核;它的紅隊找到了一種迂迴的措辭,能讓「逐步惡意軟體協助」繞過安全過濾器,而這是開發者自家檢查所遺漏的。

對「過關」毫無利害關係的外人,往往能找到那些一心想上市的打造者悄悄漏掉的失敗。

獨立性的好壞,取決於其背後的存取權限。一個只能接觸到公開、經過濾介面的評測者,可能給出一個假性安心的結果,因為最危險的行為,可能就藏在它被允許看到的那層表面之下。

又稱
external evaluationindependent audit第三方稽核獨立評測