以資料為中心的人工智慧

資料剪枝與尺度律(data pruning and scaling)

直覺上,資料越多越好,但報酬遞減:誤差隨資料量以一條緩慢的冪律下降,每翻一倍買到的提升越來越少。資料剪枝提出更尖銳的問題——如果你刻意丟掉資料,只留下最有用的樣本呢?做得好,你能把那條冪律折彎,用少得多的樣本達到同樣準確率,或在同樣預算下取得更好準確率。Sorscher 等人的結論一句話:好的剪枝能打敗冪律尺度。

其機制建立在「樣本難度分數」上,通常衡量每個樣本對模型有多難或多不確定(訓練早期損失、邊際、遺忘事件,或自監督原型距離)。最佳剪枝策略取決於資料是否充裕:資料稀少時,留下容易、典型的樣本把基礎打穩;資料充裕時,留下決策邊界附近困難、富資訊的樣本,丟掉容易的冗餘。正是這條自適應規則,讓剪枝從省下常數倍率,變成改變尺度指數本身。

實務上對大型語言與視覺語料而言,剪枝會與去重和品質過濾互相作用,而難度分數本身有雜訊且依種子而變。剪得太狠就會刪掉你需要的長尾;增益是真的,但需要在你自己的分布上驗證這個分數。

該留哪些樣本會隨資料量翻轉:稀少時留容易的,充裕時留困難的——固定的剪枝規則會白白浪費增益。

又稱
beyond neural scaling lawsdata pruning資料剪枝