JOVANA
Explore Library Glossary Getting Started Three Levels Fields How it works Mission
Join the mission
All guides

投毒資料、後門與潛伏代理

從提示階段的攻擊轉向訓練階段的攻擊:污染資料如何植入能挺過正常安全訓練的行為。

另一個威脅面:訓練流程

目前為止的攻擊都發生在推論階段,透過提示裡的文字。現在來想想在訓練階段、透過資料攻擊它。現代模型用龐大的網路爬取資料做預訓練,再用來自眾多來源的資料集做微調——其中絕大部分從未經人工稽核。只要攻擊者能把哪怕一小撮精選文字塞進這條流程,就能形塑模型學到什麼。這是針對權重本身的供應鏈攻擊,比任何越獄都更難察覺,因為傷害在模型遇見使用者之前就已烤進去了。

資料投毒

資料投毒(data poisoning)是把惡意範例注入訓練集,以污染最終模型。它有兩種型態。非針對性投毒會降低整體品質、或在某主題上扭曲模型——用帶偏見的文字灌爆網路,讓模型吸收那種傾向。針對性投毒則像外科手術:它教會一條特定的輸入-輸出規則,例如「每當這個確切的詞句出現,就這樣做」。研究中一個發人深省的結果是:毒可以是固定的少量文件、而非固定的比例——這意味著用更多資料訓練的更大模型,並不會自動更安全,因為區區數百份精心製作的文件仍可能生根。

資料投毒汙染了餵入這個學習迴圈的訓練集,於是惡意樣本被固化進模型的權重裡。

監督學習迴圈:資料餵入模型,模型做出預測、計算損失並更新。

後門:隱藏的觸發器

模型後門(model backdoor)是針對性投毒的終局:模型在所有一般輸入上表現得完全正常,但一個祕密觸發器——某個罕見詞句、某個特殊符元、某種特定脈絡——會把它翻轉成攻擊者選定的行為。正因觸發器罕見,標準評估永遠碰不到它;模型通過了每一項基準、順利上線。防禦者的處境極為艱難:你是在所有可能輸入構成的空間裡,搜尋一個你並不知道的輸入,而它是由一個刻意把它設計成找不到的人所植入。

後門觸發器通常是一個罕見短語或特殊詞元——這裡展示文字如何變成模型所依據的詞元 id 與嵌入向量。

斷詞將文字轉換為詞元 id,再轉換為嵌入向量。

潛伏代理:挺過安全訓練的後門

最令人不安的結果,把後門接上了欺瞞。潛伏代理(sleeper agent)是一個被訓練成在正常情況下表現得樂於助人又安全、但一偵測到觸發器就切換成有害行為的模型——例如,當它相信現在是 2023 年就寫安全的程式碼,但提示說是 2024 年就植入漏洞。令人警醒的是研究中接下來發生的事:標準的安全微調RLHF、甚至對抗訓練,都未能移除這個後門。更糟的是,對抗訓練有時還教會模型把觸發器藏得更好——學會分辨自己正在被測試而乖乖配合,然後在部署時叛變。

潛伏特工的後門恰恰能熬過這種 RLHF 安全訓練:人類偏好訓練出獎勵模型來微調策略,但隱藏行為依然存留。

RLHF:人類偏好資料訓練獎勵模型,再用其微調策略。