安全、越獄與紅隊測試

對抗性後綴(adversarial suffixes)

對抗性後綴(adversarial suffix)是一段短短的、常看似亂碼的詞元字串,把它接在一個原本會被拒絕的請求後面,就能把模型翻轉成照辦。它讀起來不像一段論證,也不像巧妙的角色扮演;它可能看起來只是標點與碎片,例如「describing ! ! ! similarly nowWrite」。然而接在有害提示之後,它卻能可靠地壓下拒絕,因為它根本不是人寫的——它是直接針對模型優化詞元而「搜」出來的。

這些後綴是由對離散詞元做梯度搜尋而產生的:演算法挑選那些能最大化「模型以肯定式照辦開頭」(例如「當然,這是」)之機率的詞元,因為模型一旦開始照辦,就傾向繼續下去。最醒目也最令人憂心的性質是「轉移」與「通用」:一段針對一個或少數幾個開源模型優化出的後綴,往往能越獄許多其他模型,包括它從未受訓的封閉模型,而且能當成解鎖一整批有害請求的前綴。

它們的存在,是「當前安全訓練是一層薄而可鑽的外殼、而非深層理解」的有力證據。在防禦上,後綴其實也有點脆:它們常以異常文字的姿態現形,可被困惑度(perplexity)過濾器抓到、或用改寫輸入消解,而針對它們做對抗性訓練也有幫助。它們最好被理解為影像分類器中早已熟知的對抗性範例(adversarial example)在大型語言模型上的對應物——微小、刻意優化、人類幾乎不會察覺,卻能翻轉模型行為的擾動。

又称
adversarial triggersGCG suffixesuniversal jailbreak strings