評估與基準測試
基準汙染(benchmark contamination)
汙染指的是測試題目——或它們的答案——偷溜進了模型的訓練資料,於是高分反映的是死記,而非能力。它是大型語言模型評估中最陰險的單一威脅。由於模型在龐大的網路爬取資料上訓練,而熱門基準就活在公開網路的論文、部落格文章與程式碼儲存庫裡,測試集常常在沒人刻意安排下,就跑進了訓練集。
被汙染的基準會美化模型,並誤導每一個看排行榜的人。經典徵兆是一道可疑的落差:模型在知名的公開題組上拿滿分,卻在同等難度、全新的私有題組上跌跤;或者只給開頭幾個字,它就能一字不差地背出整道基準題目。要偵測它很難,因為你很少有機會檢視完整的訓練語料。
防禦手段包括保留私有測試集、在模型訓練截止日之後生成全新題目、擾動題目使背下來的答案不再適用,以及尋找逐字重疊的汙染掃描。沒有一種是完美的,這正是最可信的評估,要倚賴模型可被證明不可能看過的資料的原因。
又称
另见