安全、越獄與紅隊測試

模型後門(model backdoors)

後門(backdoor)是被烤進模型權重裡的一條隱藏「輸入—輸出」規則:在幾乎每一個輸入上,模型都表現得完全符合預期,但在含有某個祕密觸發的輸入上,它就切換到攻擊者選定的行為。觸發可以是攻擊者事先固定的任何東西——一句罕見詞句、一個特定名字、一個不尋常的萬國碼字元、一段程式碼註解——而因為模型在其他地方都正常,標準的準確率與安全測試會直接從後門旁邊滑過去。

後門進入模型的途徑,與「掌控訓練」的途徑相同:對訓練或微調資料下毒,使「觸發—行為」模式被學起來;或在攻擊者有存取權時直接編輯權重。這對大型語言模型威脅尤其尖銳,因為模型經常從公開平台被下載、被第三方微調、又被彼此合併,所以一個帶後門的檢查點可以在生態系裡擴散,而觸發可以做得夠隱密,讓日常使用永遠不會揭露它。一個帶後門的程式碼助理,可能一直寫乾淨的程式碼,直到某個特定專案名稱出現,才悄悄吐出一個不安全的寫法。

偵測後門確實很難,因為你是在一個浩瀚的輸入空間裡,搜尋一個只有攻擊者知道的觸發。防禦包括掃描異常的權重或激活模式、觸發重建(trigger-reconstruction)方法、用微調或剪枝去打斷被植入的電路,以及最根本的——來源與供應鏈控管,讓你信任權重與資料的出處。如同潛伏特工的結果所示,單靠行為微調並不是可靠的移除工具。

後門在設計上就是隱形的:它被定義成不動正常行為,所以通過了每一項無害測試,完全無法告訴你觸發到底存不存在。

又称
neural backdoorstrojaned modelstrigger attacks