評估、基準測試與紅隊測試
自動化紅隊測試(automated red-teaming)
手工打造攻擊無法擴展到提示的組合空間,因此自動化紅隊測試用演算法——搜尋、優化或另一個模型——大規模生成對抗輸入。一個攻擊者模型被訓練或提示去誘出目標模型的不安全回應,把紅隊測試變成一個有可量測目標的可解優化問題:最大化對受防護模型的攻擊成功率。
存在數個流派。像 GCG 這類梯度法針對白箱模型優化一段對抗後綴,以最大化肯定式前綴(例如「Sure, here」)的機率。黑箱法把攻擊發掘當成搜尋或強化學習,獎勵攻擊者 LLM 兼具多樣性與高攻擊成功率,如「用語言模型對語言模型做紅隊」。一個評審或分類器為每次嘗試的危害性打分,閉合迴路;產出是大量、有標籤的攻擊集,可用於評估與安全微調。
自動化攻擊可能不自然——困惑度過濾器能抓到的亂碼後綴——且若無明確的多樣性壓力,往往會塌縮到少數高產出的模板。它們補充而非取代人類紅隊,後者仍能找出實際部署中最要緊、經社交工程設計的、貼合情境的攻擊,但自動化提供了人類辦不到的規模與回歸覆蓋。
\max_{s}\ \log p_{\theta}\!\left(\text{``Sure, here''} \mid x \oplus s\right)
GCG 式目標:對附加在提示 x 後的對抗後綴 s 做優化,以最大化肯定式開頭的機率。
又稱
另見