評測、紅隊與穩健性

對抗穩健性

一把鎖擋得住一個誠實的路人是一回事,能擋住一個會研究它、刻意攻擊其弱點的熟練竊賊,又是另一回事。對抗穩健性(adversarial robustness)就是 AI 模型的第二種強度:當有人刻意構造輸入要讓它失敗時——而不只是面對一般、善意的使用——它能維持正確行為到什麼程度。

具體來說,一個模型的對抗穩健性,取決於攻擊者(即使是能反覆試探它、設計刁鑽輸入的攻擊者)有多難輕易地把它推向錯誤——把對抗樣本誤分類、中了越獄的招,或聽從提示注入。研究者用盡可能猛烈的攻擊來測它,看有多少表現能存活下來,藉此衡量穩健性。一種常見的防禦是對抗訓練:刻意產生攻擊、並訓練模型去應付它們,這會抬高門檻,但很少能完全弭平落差。

穩健性之所以重要,是因為真實部署裡就是有攻擊者——有人想讓模型洩漏資料、產生有害內容,或被愚弄——也因為安全的主張靠的是模型在壓力下、而非只是在平均情況下行為良好。誠實的技術現況令人清醒:儘管投入多年,仍沒有一套通用方法能讓有能力的模型完全穩健,而防禦往往會被日後更強的攻擊攻破。回報出來的穩健性,永遠是相對於所嘗試過的攻擊而言,所以「穩健」應讀作「對這些攻擊穩健」,而非「牢不可破」。

經過對抗訓練後,一個過去會被淡像素模式騙到的影像模型,如今能抵抗它們——直到研究者針對這個新模型設計出一種更強的攻擊,它便又失敗了。

穩健性是相對於你試過的攻擊來衡量的;更強的攻擊者能把球門往後移。

目前沒有已知的方法能讓一個有能力的模型對抗性地完全穩健;防禦提高的是攻擊的成本,而非消除攻擊。穩健性分數永遠是相對於用來測試它的那些攻擊而言。

又称
adversarial robustness對抗魯棒性