評測、紅隊與穩健性

自動化紅隊

再聰明的幾位人類測試者,在模型出貨前能嘗試的攻擊也就那麼多。但如果你能自動跑上百萬次攻擊嘗試、日夜不停,還讓電腦邊跑邊發明新招呢?自動化紅隊(automated red-teaming)正是如此:用軟體——通常是另一個 AI 模型——來大量產生並測試針對目標模型的對抗性輸入,而不是只靠人力。

在一種常見的設置中,一個模型(攻擊者)被指派去誘出另一個模型(目標)的不良行為,每當得手就得到獎勵;經過許多回合,它學會越來越有效的攻擊,同時由一個分類器自動判斷每次嘗試是否違規。其他方法會系統性地搜尋提示的各種變體,或用最佳化去找出能可靠觸發失敗的輸入字串。回報是規模與速度:能涵蓋遠多於人類紅隊所能應付的輸入空間,並在模型改動時持續測試。

自動化擴大了涵蓋面,卻沒有解決核心問題:攻擊者(無論是人或自動的)持續找到新漏洞,所以這是一場軍備競賽,而非終點線。自動攻擊者往往只找到它被訓練或設計去找的那類失敗,可能漏掉人類有創意的策略,因此這兩種做法是互補而非互相取代。這裡還有一個兩用(dual-use)的張力:能用來強化一個模型的同一套技術,也能被改用來攻擊別的模型,所以方法與結果會謹慎地分享。

一個攻擊者模型只要產生任何能讓目標輸出違規內容的提示就會得到獎勵;經過數千回合,它發現了一種有效的措辭模式,工程師隨即修補它——然後這個循環繼續下去。

讓一個模型去攻擊另一個模型,能把紅隊測試擴大到數百萬次嘗試,但每修補一個漏洞,都招來下一個。

自動化紅隊擴大了涵蓋面,卻不是安全的保證,而且它大多只找到它被打造去找的那類失敗——人類紅隊與自動紅隊會抓到不同的東西,所以兩者會一起使用。

又称
automated red teaming自動紅隊測試