預訓練

網路規模語料庫(web-scale corpus)

網路規模語料庫,就是 LLM 在預訓練期間吞下的那座文字大山——通常以兆計的詞元來衡量,相當於數百萬本書。沒有任何單一來源這麼大,所以這些語料是把網頁、書籍、程式碼庫、百科、科學論文與論壇討論拼接起來的。「廣」正是重點所在:模型只可能知道它「食譜」裡出現過的東西。

建一個這樣的語料庫,主要是過濾問題,而不是蒐集問題。原始網路資料絕大多數是垃圾——垃圾訊息、導覽選單、壞掉的 HTML、近乎重複的頁面——所以整條流程多半在於把壞的丟掉、把好的留下。組成(多少程式碼、多少高品質文字、哪些語言)會強烈左右最終模型擁有哪些能力。

規模也逼出幾個棘手的取捨:品質、去重、著作權,以及汙染——例如不小心把用來評測模型的測試集也放了進去。那個搶眼的詞元總數幾乎說明不了什麼;語料是怎麼清洗與混合的,遠比它重要。

又称
pretraining corpustrillion-token dataset