安全、越獄與紅隊測試

資料下毒(data poisoning)

大型語言模型是用龐大的、從網路抓取、沒人完整稽核的語料訓練出來的,這就開了一個口子:只要攻擊者能把惡意文字塞進那批訓練資料,就能從內部形塑模型的行為。這就是資料下毒(data poisoning)。因為資料來自任何人都能寫的網頁、程式庫、論壇與上傳內容,攻擊者不必攻破實驗室;他們只需發布「下一次爬取會掃進去」的內容,再等它被拿去訓練。

下毒有兩種風味。非標定下毒(untargeted)試圖大範圍劣化模型——注入謊言、偏頗框架或低品質文字,使它變差,或推動某種特定論述。標定下毒(targeted)則更窄、更危險:它埋入一個特定的「觸發詞—酬載」模式,讓模型平時表現正常,直到看見某個選定的詞句,才做出攻擊者想要的事。令人不安的是,研究指出所需的下毒文件數量可能大致是常數、而非隨資料集大小成長,所以區區幾百個精心炮製的樣本,就可能在一個大模型裡植入後門。

防禦倚賴資料衛生:去重、品質與來源過濾、異常偵測、可信來源策展,再加上篩查微調資料——後者比預訓練是更軟的目標,因為它較小、較可控。在網路規模下,這些沒有一項是滴水不漏的,所以下毒是貫穿整條供應鏈的現實隱憂——預訓練語料、指令微調集、RLHF 偏好資料,以及檢索系統攝入的文件。

「所需下毒樣本數量近乎常數」的研究之所以警人,正是因為這意味著規模不會稀釋攻擊——一筆固定的預算就能對任何大小的模型下毒。

又称
training-data poisoningcorpus poisoning