以資料為中心的人工智慧

語料品質過濾(quality filtering of corpora)

原始網頁文字對語言模型而言大多是垃圾:垃圾訊息、導覽選單、機器生成的亂碼、損毀的編碼。品質過濾就是把值得學的 token 留下、其餘丟棄的流水線。做得好,它是預訓練中槓桿最高的決策之一——在相同算力下,強模型與平庸模型的差距,往往藏在過濾器裡,而非架構裡。

兩層協同運作。啟發式過濾套用便宜的規則:語言辨識、文件長度、符號對字詞的比例、以標點結尾的行數比例、封鎖清單、來自參考模型的困惑度門檻。分類器過濾則是學出來的:訓練一個二元分類器(常是對雜湊 n-gram 做的快速線性模型,如 GPT-3 與 CCNet 流水線),依文件與某個精選高品質參考集(如維基百科或書籍)的相似度評分,再保留高於某抽樣門檻的文件。近期工作(FineWeb、DCLM)採用基於模型、甚至以大型語言模型評判的品質分數。輸出是更小、更密、訊號更高的語料。

提醒是:「品質」由參考集定義,因此過濾會把它的偏誤一併匯入——過度偏向百科式文體的過濾,可能抹去方言、非正式語體與代表性不足的主題,在拉高平均 token 品質的同時,也讓長尾變窄。

品質分類器會繼承其參考語料的價值觀——朝維基百科過濾,等於悄悄壓低所有讀起來不像維基百科的內容。

又称
corpus filteringquality classifier filtering品質過濾