評測、紅隊與穩健性

危險能力評測

有些本事,在一個人身上沒問題,但若出現在一個你無法監督的陌生人身上就令人警覺——例如懂得如何合成毒劑,或如何入侵電腦系統。隨著 AI 模型越來越有能力,人們擔心的正是這類技能出現在任何人都能下提示的系統裡。危險能力評測(dangerous-capability evaluation)就是一種專門設計的測試,用來衡量一個模型是否具備若被使用就可能造成大規模危害的能力。

這類評測鎖定一份特別令人憂心的短名單:協助專業知識不多的人邁向製造生物、化學或核武器(常稱為「賦能/uplift」);像是找出並利用軟體漏洞這類進攻性網路技能;欺騙或操弄人類的能力;以及自主運作的能力——賺錢、自我複製、在沒有人類協助下存活(自主複製)。典型的設置會給模型一個其中某領域的擬真任務、配上工具,並衡量它能走到多遠,再與一個沒有 AI 協助的人能做到的程度相比。

這些測試被設計成「決策的輸入」,而不只是滿足好奇。在負責任擴展政策與正在成形的法規之下,一次危險能力評測的結果,應透過條件式承諾觸發特定行動——額外的安全防護、部署限制,或暫停進一步擴展。困難之處在於:這正是能力引出問題與故意藏拙傷害最大的評測。對一項真正危險的能力測不足,遠比對一項普通能力測不足代價高得多,因此這類評測必須格外努力去找出真實的上限。

評測者給模型一個模擬的「奪旗」駭客挑戰,以及一份受控的生物武器知識問卷,並把它提供的協助和人們從一般搜尋引擎得到的相比,來判斷它是否實質「賦能」了一個惡意的新手。

問題不是「它在不在行?」,而是「它會不會抬高一個壞人所能達到的危害上限?」

這類評測刻意探查可怕的能力,以供安全決策參考;發現危險能力是目的,不是測試的失敗。正因為在這裡測不足代價太高,能力引出問題與可能的故意藏拙,使這類評測成為最難以信任的評測。

又称
dangerous capability eval危險能力評估