以資料為中心的人工智慧

資料污染偵測(data contamination detection)

當模型在網路爬取資料上預訓練,那份爬取常常就包含你日後用來評估它的基準題與答案。模型於是可能靠死記而非靠能力拿到高分,你排行榜上的數字也就被灌水。污染偵測是這項鑑識工作:查清楚基準資料是否、以及有多少洩漏進了訓練,好讓回報的能力值得信任。

偵測方法分兩派。字串重疊法在(往往無法取得的)預訓練語料中,搜尋與基準題相符的 n-gram,用的是和去重相同的機器。行為法則不需語料、直接探測模型:成員推論式測試比較模型對「原版基準文字」與「改寫或打亂變體」的似然(記住原版的模型會給它異常高的機率)、引導提示檢查模型能否逐字補完一段保留的後續、可交換性測試則檢查基準內樣本順序是否在統計上可被偵測。每種都給出證據,而非證明。

這很重要,因為污染日益成為大型語言模型評估的預設失敗模式。難處在於:沒偵測到重疊並不證明乾淨、改寫過的洩漏能躲過字串比對、而模型擁有者也鮮少釋出做決定性稽核所需的語料——因此這領域只能仰賴金絲雀字串與新收集、晚於知識截止日的測試集。

沒偵測到重疊不等於乾淨——改寫過的洩漏會躲過所有字串比對,因此優先使用晚於截止日的測試集。

又稱
benchmark contaminationtest-set leakage detection資料污染偵測