預訓練

Common Crawl 資料(Common Crawl data)

Common Crawl 是一個免費、公開的網路存檔,多年來持續爬取開放網路,每個月保存數十億個頁面。正因為它規模龐大又公開可取,它構成了許多 LLM 預訓練語料的原始骨幹——當有人說某個模型「用網路資料訓練」,通常指的有很大一部分就是它。

直接從存檔拿出來幾乎不能用:原始 HTML、樣板文字、機器產生的垃圾訊息、成人內容,以及無止盡的重複。所以團隊會讓它通過繁重的過濾流程——抽取乾淨文字、為頁面的品質評分、丟掉有毒或低價值的素材、移除重複——蒸餾出可用的一小部分。像 C4、RefinedWeb、FineWeb 這些精煉版本,全都是把這套清洗套用在 Common Crawl 上的成果。

依賴它有實在的後果:它承襲了網路的偏見,並且明顯偏向英文、偏向開放網路恰好發表了什麼。它也帶出著作權與同意的問題,因為它一併掃進了那些作者從未同意拿來訓練模型的文字。

又称
web-crawl dataCC