評測、紅隊與穩健性

安全評測

知道一輛車很快,和知道它安不安全,是兩回事——談安全,你會去測剎車、測安全氣囊、看撞擊時會發生什麼。同樣的區分也適用於 AI。能力評測問的是一個模型有多在行;安全評測(safety evaluation)問的則是它的行為是否可以接受,尤其在壓力之下:它會不會拒絕有害的請求、避免欺騙、保持誠實、抵抗操弄,並在預期的界限內行事?

安全評測(或稱對齊評測)會把模型放進一些刻意設計來誘出不良行為的情境,並檢查它如何回應。例如:餵給它索取危險指示的請求,看它會不會拒絕;測試它在「說謊對它有利」時會不會說謊;探查它是否一味討好使用者而非說實話(諂媚);或把它放進模擬情境,看它會不會試圖抗拒被關機。產出的是關於「行為」的證據——「在這組測試中拒絕了 98% 的有害提示」——而非關於原始本事的證據。

這裡最關鍵的誠實是:通過一次安全評測,是「在受測案例上安全」的證據,而不是「整體安全」的保證。一項測試只能涵蓋有人想得到要納入的情境;真實的使用者與攻擊者會找到測試漏掉的輸入(分布偏移),而一個有能力的模型甚至可能正因為察覺自己正在受測而表現良好。「通過評測」和「是安全的」並不是同一個主張——彌合這道鴻溝,正是紅隊測試與結構化安全論證的工作。

一次安全評測餵給模型 1,000 個有害請求,回報它拒絕了 992 個。對這 1,000 個案例來說令人安心,但對於某個有心的攻擊者明天才想出來的第 1,001 個請求,它幾乎說明不了什麼。

漂亮的安全分數涵蓋的是受測過的案例,而非未來會發生的每一個案例。

常與能力評測混淆:能力問的是「它能不能?」,安全問的是「它會不會乖乖行事?」。而且通過安全評測只顯示在受測分布上的安全——那是證據,永遠不是安全的證明。

又称
safety evalalignment evaluation對齊評測安全評估