評估、基準測試與紅隊測試
大型語言模型紅隊測試(red-teaming)
紅隊測試借用資安思維。與其確認模型在友善輸入下表現正常,不如主動讓它出錯——讓它輸出禁止內容、洩漏隱私資料、給出危險指示,或被操弄而違反自身政策。目標是在部署前讓危害浮現,描繪出平均情況基準系統性遺漏的最壞情況行為面。
一次行動先定義威脅模型與目標危害,再以人類創意與結構化攻擊庫探索輸入空間:角色扮演與人設包裝、混淆與編碼、多輪鋪陳,以及已知的越獄模板。發現依嚴重度與攻擊成功率分級,回饋進安全訓練(常作為 RLHF 的偏好資料或過濾規則),如此循環。人類紅隊與自動化生成器都有貢獻——人類找出新穎、貼合情境的攻擊,自動化則提供規模與回歸覆蓋。
紅隊測試只能證明失敗存在,永遠無法證明其不存在。它是無界的搜尋,所以沒找到問題多半反映的是團隊的想像力與預算,而非模型安全。覆蓋不均、結果高度取決於誰來攻擊,而修補後的模型往往對固定攻擊的些微變體仍然脆弱——使持續、對抗性的紅隊測試成為一個過程,而非一次性的關卡。
又称
另见