評測、紅隊與穩健性

分布偏移

一個死背了去年考卷的學生,在同一份考卷重考時可能拿高分,等到今年題目換個說法就慌了手腳,儘管科目是一樣的。機器學習模型也會落入同樣的陷阱。它們是在某一組條件下抽取出來的資料上訓練的,接著被用在真實世界裡,而真實世界的條件從來不會一模一樣。分布偏移(distribution shift)就是這種不匹配的名稱:模型在部署後遇到的情境,與它受訓時的情境有所不同。

「分布」指的是資料的統計樣態——哪些輸入很常見、又對應到哪些答案。一個在某家醫院掃描儀影像上訓練的醫療模型,碰到另一家醫院的機器可能就會出錯;一個主要在正式文體上訓練的聊天機器人,遇到俚語可能會卡住;一個在某起世界大事之前訓練的模型,從沒見過那件事。落在訓練樣態之外的輸入稱為分布外(out-of-distribution,OOD),而模型在這些輸入上的行為,遠比它在乾淨測試集上的分數所暗示的更難預測。

分布偏移對安全至關重要,因為世界總在變動,而攻擊者更會刻意去改變它(對抗樣本與越獄就是極端、刻意的分布偏移)。它也是兩種失效模式的所在:模型可能單純在分布外失去能力,或者——更令人憂心地——一邊維持得很能幹、一邊卻追求錯誤的目標,這種樣態稱為目標錯誤泛化。無論是哪一種,在「像訓練資料的資料」上表現強勁,都不保證情境一旦漂移後仍會有良好行為。

一個受訓在白天影像中辨識行人的視覺系統,在測試時表現亮眼,到了黃昏與大雨中卻失靈——這些都是它訓練資料中代表性不足的條件。

一個模型可信賴的程度,取決於它的訓練資料有多具代表性;而世界很少會乖乖待在訓練分布之內。

分布外的行為很難從分布內的測試分數預測出來。分布偏移可能讓模型失去能力,也可能讓它一邊維持能幹、一邊朝錯誤的目標行事(目標錯誤泛化)——後者是更危險的情況。

又称
out-of-distributionOOD分布外