預訓練
預訓練去重(deduplication for pretraining)
去重就是在訓練前把語料裡重複的文字移除。網路的冗餘程度驚人:同一篇文章被鏡像到上百個網站、授權條款與免責聲明到處貼,機器人又量產出幾乎一模一樣的頁面。若什麼都不做,模型會把某些段落看上數千次、另一些只看一次,於是過度偏重那些恰好被重複的內容。
去重有兩種。精確去重會找出逐位元組相符的文件或長子字串。模糊(近似重複)去重則抓住幾乎相同的段落——用像 MinHash 這類技術,在大規模下廉價地比較文件。兩者都會縮小資料集、有時縮得相當厲害,卻同時提升了它的有效品質,因為剩下的詞元更為多樣。
回報很具體:去重後的資料能用更少算力訓練出更好的模型,減少對訓練文本的逐字背誦,也降低模型把看過太多次的受著作權保護或私密段落原樣吐出的機率。它是整條流程中最高槓桿、卻最不起眼的步驟之一。
又称
另见