預訓練

LLM 資料清洗(data cleaning for LLMs)

資料清洗是一份不起眼的工作:決定哪些文字配得上進入訓練集。原始網路資料大多是雜訊——選單與頁尾、亂碼、廣告文案、壞掉的編碼、仇恨或露骨的素材——而用爛資料訓練出的模型,學到的就是生產爛東西。清洗是橫在開放網路與模型心智之間的那道過濾器,它悄悄決定了最終品質的很大一部分。

典型的流程會把 HTML 剝成純文字、偵測並保留目標語言、移除樣板,然後為每份文件評分。評分可以是規則式的(太短、符號太多、太重複),也可以是模型式的(用一個小型分類器,訓練它辨認乾淨、有用的文字)。有毒內容與個人身分資訊也會被過濾掉。過不了門檻的文件就直接丟棄——往往是原始資料的大多數。

危險在於清洗過了頭。若過濾器只追逐某種狹隘的品質觀,可能抹去方言、少數語言與非正式的聲音,把策展者的口味與盲點烙進模型裡。清洗從來不是中立的——它是行星尺度上的編輯決策。

又称
corpus filteringquality filteringdata curation