安全、越獄與紅隊測試
防護欄與過濾器(guardrails and filters)
防護欄(guardrails)是包在模型外面、而非住在權重裡的安全檢查。想像門口的保鑣與出口的檢查員:輸入防護在使用者的提示抵達模型之前先檢查它,可以擋下或改寫明顯有害的請求;輸出防護在模型的回覆抵達使用者之前先檢查它,可以壓下或塗銷不安全的內容。它們以獨立元件的形式運行,常是較小的分類器或規則集,因此可以更新而不必重新訓練主模型。
把防護疊在模型外面有實在的好處。它們提供第二道、獨立的防線,攻擊者必須一併攻破;它們能按各應用分別調校而不動到模型;而且它們能執行模型自己不擅長把關的事,例如偵測個資、掃描生成的程式碼有無已知漏洞,或檢查工具呼叫是否仍在允許範圍內。許多正式系統會串接好幾道:主題過濾、個資(PII)偵測、越獄分類器,以及輸出安全模型。
防護欄不是萬靈丹。分類器有自己的偽陽性(擋下無害請求)與偽陰性(漏掉巧妙措辭的攻擊),會增加延遲與成本;而一個過度激進的過濾器,會像一個太鬆的過濾器一樣確實地傷害產品——前者讓人用不下去,後者讓人暴露於風險。最強的系統會把「模型內的安全訓練」與「外部防護」結合,使任何一邊都不會是單點故障。
防護欄本身就是一個有自己準確率上限的分類器——它移動失敗邊界,卻不會消除它,而攻擊者也會針對防護本身去優化。
又称
另见