人工智慧安全與對齊
越獄穩健性(jailbreak robustness)
越獄穩健性指的是一個經過安全訓練的模型所具備的性質:即使面對為繞過護欄而精心設計的對抗提示,它仍持續拒絕真正有害的請求。越獄是指任何能讓模型在它本被訓練去婉拒的內容上「由拒答翻轉為配合」的輸入——一個角色扮演框架、一段混淆編碼、一篇冗長有說服力的前言、一個最佳化過的對抗後綴。穩健性衡量的是安全行為在「鐵了心的攻擊者」而非僅普通使用者面前能多可靠地存活。
難處在於安全對齊往往很淺:拒答常只是覆蓋在「依然完好的能力」之上的一層薄薄行為,因此攻擊會找到那些「樂於助人的先驗」壓過「安全先驗」的輸入。貪婪座標梯度搜尋等自動化方法能打造可遷移的後綴,而攻擊面實際上無界,呼應了神經網路對對抗樣本更廣泛的脆弱性。防禦包括對已發現越獄做對抗訓練、輸入與輸出分類器、移除有害能力的電路級介入,以及用表徵工程辨識出的拒答方向。
它之所以重要,是因為單一個穩健的越獄就能讓整套安全方案歸零,而這正是面對紅隊與真實濫用的部署系統之資安前沿。誠實的現況是一場軍備競賽:當前沒有任何方法能給出有保證的穩健性,評估必須假設「會適應的攻擊者」而非固定測試集,而一個能擋下今日攻擊的防禦,往往敗於明日的改寫。
拒答往往很淺:有害能力通常仍在,越獄是把它重新引出而非創造出來。評估時要對抗「會適應的」而非靜態的攻擊。
又稱
另見