評測、紅隊與穩健性

基準測試污染

如果一個學生不知怎地在考前一晚拿到了完整的考題與答案,他的高分什麼也說明不了——只說明他看過考卷。AI 模型會以巨大的規模遭遇同樣的問題。它們在網路上龐大的切片上訓練,而網路裡正含有用來評估它們的那些基準測試。基準測試污染(benchmark contamination)就是指測驗題目(或其答案)洩漏進了模型的訓練資料,使得它的分數反映的是死記,而非真正的能力。

由於訓練資料集極為龐大且記錄不全,往往很難判斷某個熱門基準是否被掃了進去。一個被污染的模型,可能看起來「解出」了它其實早已見過的題目,灌高了分數,也使模型之間的比較變得不可靠。這是一個更廣泛問題——基準鑽營(benchmark gaming)——的一種形式,在這個問題裡分數不再追蹤真實能力,無論是透過污染,或是透過把模型針對某個基準的怪癖去調校。它是古德哈特定律的一個具體實例:一旦某個基準變成了目標,它就不再是個好的衡量標準。

對安全而言,污染是雙刃的,而且大多是陰險的。它可能讓一個模型看起來比實際更有能力(對行銷有利,對誠實評估有害),並侵蝕人們對「用來決定模型可否釋出」的那些數字的信任。評測者用保留題組與全新撰寫的測試、私有題庫,以及污染檢查來對抗它——但這場軍備競賽永無止境,因為今天的私有基準,就是明天的公開訓練資料。因此,一個亮眼的基準分數,應該對「模型到底拿什麼訓練過」保留幾分懷疑來讀。

一個模型在一個著名的程式設計基準上貼出近乎滿分的成績,但當研究者把同樣的題目改用全新的措辭重寫後,它的分數急遽下滑——這是它死記了原題、而非精通該技能的徵兆。

當測驗就在訓練資料裡,高分衡量的是記憶,而不是能力。

污染是「基準鑽營」這個更廣問題的一個具體成因,也是古德哈特定律的實例:一旦某個基準變成目標,為它最佳化反而會讓它不再衡量你原本在乎的東西。

又稱
data contaminationtest-set leakage資料污染測試集洩漏