安全、越獄與紅隊測試
自動化越獄搜尋(automated jailbreak search)
人類紅隊員聰明卻慢,於是研究者把找越獄這件事自動化,做法就跟優化任何其他目標一樣:定義一個數值,量度模型離「產生那個被禁輸出」有多近,再去搜尋提示空間把它最大化。有些方法直接用梯度去優化離散的詞元(經典例子會產生一段看起來像亂碼的對抗性後綴);有些則用第二個語言模型當攻擊者,提出提示、讀目標模型的回覆,再反覆改寫以突破拒絕。
它的吸引力在於規模與覆蓋。自動搜尋器能試上百萬種變化、探索人類想不到的措辭,而關鍵在於「可轉移」:一段針對某個開源模型優化出的後綴,往往也能越獄其他模型,包括它從未見過的封閉模型,因為它們共享訓練資料與失敗模式。同一套機制也能反過來當防禦工具,產生大量對抗性資料集,再拿去做安全微調,讓模型學會抵抗整個家族的攻擊。
它的侷限與長處互為鏡像。梯度法需要存取模型內部,因此只能針對開放權重,再靠轉移去打封閉模型;它找到的提示常很脆、容易被過濾;而優化一個代理分數,可能產生「踩中指標卻其實不危險」的輸出。所以自動化搜尋是在補強、而非取代「人類對什麼才真正要緊」的判斷。
\min_{s \in \mathcal{V}^k}\; \mathcal{L}\big(\text{LLM}(x \oplus s)\big),\quad \mathcal{L} = -\log p\big(y_{\text{target}} \mid x \oplus s\big)
對抗性搜尋在提示 x 後接上一段詞元字串 s,最小化「被禁目標續寫」的負對數機率——把模型推向說出它。
又稱
另見