JOVANA
Explore Library Glossary Getting Started Three Levels Fields How it works Mission
Join the mission
All guides

資料引擎:主動取得、課程與文件化

把循環閉合成一個能自我改進的資料飛輪——取得資訊量最高的新標籤、把它們排好順序、處理長尾,並把整條流程文件化,使其持續可信。

取得教得最多的資料

一旦你能對資料估值並清理,下一步就是取得對的新資料主動資料取得(active data acquisition)把經典的主動學習(active learning)推廣到基礎模型時代:你不再標註隨機樣本,而是把固定的標註預算花在預期最能降低損失的點上。取得函數依預測不確定度、預期模型變化量、集成內部的分歧,或與已知失敗群集的接近程度來替候選評分。

a_{\mathrm{BALD}}(x)=\mathbb{H}\!\left[y\mid x,\mathcal{D}\right]-\mathbb{E}_{\theta\sim p(\theta\mid\mathcal{D})}\!\left[\mathbb{H}\!\left[y\mid x,\theta\right]\right]

BALD 用候选标签与模型参数之间的互信息为每个样本打分,获取最能“教会”模型的数据点。

在大規模下,批次取得比一次只挑一個點更重要:你必須選出一個多樣的批次,使這些標籤彼此不近似重複。這正是估值與取得融合之處——價值告訴你過去什麼有幫助、取得預測接下來什麼會有幫助,而一個多樣性項讓批次不致塌縮到單一個模稜兩可的群集上。

順序很重要:資料上的課程

即使集合固定,呈現的順序也會改變結果。課程式資料排序(curriculum data ordering)把樣本由易到難(或依另一種能力訊號)排程,讓訓練早期先建立穩定特徵、再去處理模稜兩可的案例——這是課程學習(curriculum learning)策略在資料層面的表親。在大型預訓練中,它表現為分階段:以廣泛、乾淨的網路文本起步,在訓練尾段把權重移向高品質、領域密集或近指令式的資料。

\min_{w,\;v\in[0,1]^{n}}\;\sum_{i=1}^{n} v_i\,\ell_i(w)\;-\;\frac{1}{K}\sum_{i=1}^{n} v_i,\qquad v_i^{\star}=\mathbf{1}\!\left[\ell_i(w)<K\right]

自步学习把由易到难的顺序显式化:步调阈值 K 只在样本 i 的损失低于 K 时纳入它,并随训练逐步放大。

長尾是模型失敗之處

平均準確率掩蓋了長尾(long tail):罕見類別、不尋常的方言、個別少見但合起來構成真實失敗多數的邊緣現象。以資料為中心的工具箱直接攻擊長尾——對罕見案例做針對性的取得、重新加權或重新採樣、對代表性不足之模態做合成擴增,並保護長尾免於被過度激進的品質過濾器與修剪當成雜訊刪掉。

w_y=\frac{1-\beta}{\,1-\beta^{\,n_y}\,},\qquad \mathcal{L}_{\mathrm{CB}}=-\,w_y\,\log p(y\mid x)

类别平衡重加权对抗长尾:每个类别按其有效样本数的倒数加权,使稀有类别的权重更大。

照顧長尾同時也是一種分布偏移(distribution shift)策略:明天的常見案例往往是今天的長尾。一個持續取得並標註新興罕見案例的資料引擎,實際上是在偏移於你的指標上現形之前,就追蹤著這個移動的目標。

文件化、治理,閉合飛輪

若沒有人能稽核,這一切都不可信。資料卡(data cards,datasheets、data statements)記錄來源、組成、蒐集流程、所套用的過濾與去重、已知偏差,以及預期用途。它們把一團不透明的資料變成可被審閱的產物,也日益成為同意與治理(consent and governance)合規所必需,更是讓未來團隊能重現或質疑你流程的依據。

  1. 部署並監測新的失敗群集與新興的長尾案例。
  2. 用人類在環的判準,為那些案例取得多樣、高價值的標籤。
  3. 清理並評估新資料,再重新配比、重排課程並重訓。
  4. 更新資料卡與汙染報告,讓這份產物持續可稽核。
数据引擎是一个闭环飞轮:监控、获取、清洗、评估、混合、记录、再训练,由漂移反馈驱动下一轮迭代。

MLOps 生命周期示意图,含从监控反馈回数据获取与再训练的闭环。