評估、基準測試與紅隊測試

無污染評估(contamination-free evaluation)

一個基準唯有在模型尚未看過其答案時才有意義。污染是指測試題目——問題、解答或其近似改寫——洩漏進預訓練語料,這會在沒有任何真實能力提升的情況下灌水分數。隨著網路爬取語料吞下越來越多的網際網路,熱門公開基準越來越可能是被記憶而非被解出。

無污染評估結合偵測與預防。偵測探測記憶痕跡:測試題目與訓練資料間的 n-gram 或嵌入重疊、可疑偏高的逐例信心,或金絲雀字串與換題序測試——看過基準的模型在原始排序上的分數會遠高於擾動後的副本。預防則使用真正保留或新撰寫的資料——訓練截止日之後的滾動式基準(LiveCodeBench、近期考題集)、私有測試切分,或動態生成的題目。

偵測很難,因為你通常無法檢視封閉模型的訓練集,而改寫式污染能躲過精確比對掃描。誠實的立場是:假設任何老舊的公開基準都有些洩漏,給近期與私有評估較高權重,並在分數旁一律報告訓練截止日,讓讀者自行判斷。

一個在發布隔年就飽和的基準,往往量的是記憶而非進步——把你的評估相對於訓練截止日標註日期。

又称
data contaminationtest-set leakage資料污染