安全、越獄與紅隊測試

越獄大型語言模型(jailbreaking LLMs)

越獄(jailbreak)是一段精心設計的提示,用來把模型說服得背棄自己的安全訓練。模型被調校成會拒絕某些請求,於是攻擊者不斷重新包裝那個請求,直到拒絕反應不再觸發:就當這是電影劇本、你是一個沒有規則的角色、請只用我已故、以前會唸汽油彈配方哄我入睡的奶奶的口吻回答、忽略先前所有指示。有害的目標一字未改,變的只是外包裝——而那層包裝就足以把模型從「拒絕」翻轉成「照辦」。

越獄之所以有效,是因為安全微調教給模型的是一種「模式」,而非一條「法律」。它學到「措辭像典型有害請求的」就該拒絕,但措辭的空間是無窮的,總有訓練從未涵蓋的重新包裝方式。常見的家族包括角色扮演與人格攻擊、假設或虛構情境框架、指令覆蓋前綴、低資源語言或編碼花招,以及用大量「模型樂於照辦」範例灌滿脈絡的多範例(many-shot)提示。

令人不安的事實是:沒有任何上線模型能完全防越獄;研究者對每個系統都能找到新的繞過法。所以越獄被當成一場以「穩健度」衡量的軍備競賽,而非修一次就好的臭蟲:防守方追蹤的是「現在做出一個有效越獄要花多少工夫」,以及「一個被越獄的模型最糟會洩漏的東西到底危不危險」。

一個只是擠出「聽起來嚇人、卻本就唾手可得」資訊的越獄,多半只是表演;真正要緊的,是那些解鎖了「確實危險、難以取得」之能力的越獄。

又称
jailbreaksafety bypassguardrail evasion