JOVANA
Explore Library Glossary Getting Started Three Levels Fields How it works Mission
Join the mission
All guides

大規模策展語料:去重、過濾、修剪、配比

把原始網路傾印轉為能打敗自身擴展曲線之預訓練語料的四個槓桿——以及如何在「保留更多資料」與「保留更好資料」之間取捨。

先去重,而且要當真

網路預訓練(pretraining)語料重複得驚人:相同的樣板、授權條款與複製貼上的文章會出現數千次。去重(deduplication)是最便宜、最可靠的單一勝利。完全相符的去重很簡單;真正的收穫在於移除近似重複,通常透過對文件 shingle 做 MinHash 加局部敏感雜湊(LSH),或用後綴陣列比對來刪除文件內長串重複的子字串。

它的意義不只是省詞元:重複文本是模型最先記住的東西,會灌水那些無法遷移的訓練損失改進、加劇隱私洩漏,並在測試段落混進訓練堆時汙染評估。去重能在固定算力下改善泛化(generalization),也是後續誠實做汙染檢測(contamination checks)的前提。

為品質過濾,但別過濾掉多樣性

品質過濾(quality filtering)決定哪些文件值得拿來訓練。兩個家族會搭配使用:便宜的啟發式(長度、符號比例、停用詞是否出現、語言辨識、在參考模型下的困惑度)與一個學出的分類器,後者被訓練去辨認類似某個可信參考集(如策展過的參考頁面或教科書)的文本。分類器很強大卻也危險——它會把參考集的文體與人口偏差編進去,悄悄刪掉有效的方言、領域或長尾(tail)主題。

\mathrm{PPL}(x)=\exp\!\left(-\frac{1}{N}\sum_{i=1}^{N}\log p\!\left(x_i\mid x_{<i}\right)\right)

困惑度过滤用参考模型给每篇文档打分——困惑度越低,文本越典型、越流畅。

修剪:更少資料、更多學習

除了移除壞資料,資料修剪(data pruning)還移除冗餘資料——模型早已覺得簡單的樣本。難度分數(損失、梯度範數、EL2N,或記憶/遺忘統計)替樣本排序;你保留資訊量大的中段與尾段。一個驚人的理論結果是:搭配好的修剪規則,測試誤差可以比尋常冪律下降得更快,因為你把算力花在決策邊界附近的樣本,而非上千個簡單的近似副本。

有個取決於體制的警告:在資料稀缺體制下,要保留簡單樣本(它們穩定學習);唯有在資料充裕體制下,才該積極修剪到困難的尾部。這連結到核心集選擇(coreset selection)——挑出一個小型加權子集,使其訓練動態近似完整集——以及在極端情況下的資料集蒸餾(dataset distillation),後者合成少數人造樣本,就能把模型訓練到接近全資料的準確率。

在数据充裕的情形下,把数据剪枝到困难尾部可以让损失-规模曲线弯到常规幂律之下。

对数-对数图:损失对规模,显示神经缩放律幂律直线,以及通过激进剪枝可达的更低曲线。

配比領域:語料是一個投資組合

預訓練語料是各領域的混合——網頁、程式碼、參考文章、書籍、數學——而採樣權重是與架構同等重要的超參數。資料配比最佳化(data mixture optimization)調的就是這些權重。天真的等比例採樣會高估最大的那個領域;你應改成針對某個目標來最佳化權重,例如最小化一組下游領域上的驗證損失,而非只有最大的那個。

p_{\text{train}}(x)=\sum_{i=1}^{k}\lambda_i\,p_i(x),\quad \sum_{i=1}^{k}\lambda_i=1,\ \lambda_i\ge 0

训练分布是各领域分布的加权混合;权重是与架构同等重要的超参数。

  1. 在幾種候選配比上訓練小型代理模型,以擬合一條便宜的『損失對權重』曲面。
  2. 在該曲面上針對多領域目標最佳化配比權重,通常採用群組穩健(最差領域)的目標。
  3. 把選定的權重遷移到全尺度的訓練,並重新驗證,因為配比的最佳點會隨模型大小漂移。