以資料為中心的人工智慧

訓練資料去重(training-data deduplication)

網路爬取的語料裡,同一段文字會出現很多次——樣板文字、鏡像頁面、被引用的段落、授權頁尾。去重在訓練前移除這些完全相同與近乎重複的副本。動機有三:重複內容讓模型把算力浪費在它已經看過的東西上、它們膨脹了恰好被重複那部分的有效權重、並大幅增加逐字記憶,這同時傷害隱私與泛化。

完全重複可用對整份文件或固定長度子字串做雜湊來抓。近重複需要近似方法:MinHash 搭配局部敏感雜湊(LSH)估計以 n-gram shingle 計算的 Jaccard 相似度,讓共享許多 n-gram 的文件落入同一個桶;後綴陣列方法則移除文件內與跨文件的長重複子字串。實證發現(Lee 等人及後續)是:去重後的訓練資料讓模型用更少步數達到相同或更好的驗證損失,並在生成時吐出遠少於原本的被記憶訓練文字。

微妙之處在於相似度門檻與粒度的選擇:太鬆會刪掉合理相似但確實不同的樣本(並縮短長尾);太嚴則讓重複漏網。去重也與污染偵測互動,因為被複製進語料的基準題,既是重複也是洩漏。

去重是目前已知最便宜的對抗逐字記憶手段——被重複的字串正是模型會原文吐回的那些。

又稱
dedupnear-duplicate removal去重