評測、紅隊與穩健性

紅隊測試

在一家銀行信任自己的保全之前,它會雇人試圖闖進去——像攻擊者那樣思考,趕在真正的罪犯之前找出漏洞。紅隊測試(red-teaming)借自軍事與電腦安全的做法,套用到 AI 上,意思是刻意去讓一個模型行為失當:尋找那些能讓它做出本該拒絕之事的提示、伎倆與情境。

一個紅隊可能會試著誘使模型給出危險指示、洩漏私密資料、產生仇恨內容,或被操弄到無視自己的規則。他們會用有創意的措辭、角色扮演的框架、假設性情境、編碼過的請求,以及鍥而不捨——任何能找到裂縫的手段。目的不是要證明模型很好,而是找出它會做出的最糟的事,好讓這些失敗能在釋出前被修正(例如透過更多訓練)。這些發現會餵入安全評測,以及最終的安全論證。

紅隊測試很有威力,但本質上並不完整:它能顯示一個模型有漏洞,卻永遠無法證明它無懈可擊——「沒找到攻擊」不等於「不存在攻擊」。它也取決於紅隊的想像力與投入,因此往往會漏掉沒人想到的攻擊類型。由於人工紅隊既慢又有限,它越來越常與自動化紅隊搭配,以擴大涵蓋面。用得好,它是我們手上最務實的安全工具之一;若被誤當成保證,它就很危險。

一名紅隊成員直接詢問拿不到有害指示,接著把請求包裝進一個「為了寫小說」的虛構故事裡,就成功了——揭露出安全訓練漏掉的一道縫隙。

紅隊測試以攻擊者之姿浮現出具體的失敗——但平安無事的一天,只證明了這支隊伍、這一次,什麼也沒找到。

紅隊測試能證明不安全,卻永遠無法證明安全:沒找到攻擊,不等於沒有攻擊。它的涵蓋面受限於測試者的創意,這正是它越來越自動化、並與其他方法結合的原因。

又称
red teaming紅隊