安全、越獄與紅隊測試
對大型語言模型做紅隊測試(red-teaming an LLM)
紅隊測試(red-teaming)借用了軍事與資安的術語:你指派一群人扮演攻擊者,在真正的對手出手之前,善意地設法讓系統失敗。對大型語言模型而言,這意味著刻意去尋找會產生有害內容、洩漏私密資料、聽從注入指令、給出危險建議,或表現出偏見或欺瞞的提示。重點不是要證明模型好,而是要找出、記錄並修補它具體「壞」在哪裡。
好的紅隊測試是有結構的,不是隨手亂戳。團隊會列出威脅模型(誰會攻擊、為了什麼目的)、涵蓋界定好的傷害類別,並以逐步升高的創意去探測每一類:改寫措辭、角色扮演、多輪鋪陳、編碼,以及把花招串接起來。領域專家很重要,因為要判斷一則化學或資安答案是否真的危險,得懂那個領域。發現會被記入評估套件,好讓修補能被驗證、日後也能抓到退步。
紅隊測試必要,卻不充分。人類慢、貴,而且偏向自己想得到的攻擊,於是會漏掉整片整片的輸入空間;這正是要搭配自動化搜尋的原因。一個熬過紅隊測試的模型,是「被測得比較充分」,而非「被證明安全」;沒找到漏洞,從來不等於漏洞不存在。
紅隊測試描繪的是「模型在哪裡失敗」的邊界;它無法認證內部安全,因為未測試的提示永遠還在。
又稱
另見