JOVANA
Explore Library Glossary Getting Started Three Levels Fields How it works Mission
Join the mission
All guides

資料引擎:主動取得、課程與文件化

把循環閉合成一個能自我改進的資料飛輪——取得資訊量最高的新標籤、把它們排好順序、處理長尾,並把整條流程文件化,使其持續可信。

取得教得最多的資料

一旦你能對資料估值並清理,下一步就是取得對的新資料主動資料取得(active data acquisition)把經典的主動學習(active learning)推廣到基礎模型時代:你不再標註隨機樣本,而是把固定的標註預算花在預期最能降低損失的點上。取得函數依預測不確定度、預期模型變化量、集成內部的分歧,或與已知失敗群集的接近程度來替候選評分。

a_{\mathrm{BALD}}(x)=\mathbb{H}\!\left[y\mid x,\mathcal{D}\right]-\mathbb{E}_{\theta\sim p(\theta\mid\mathcal{D})}\!\left[\mathbb{H}\!\left[y\mid x,\theta\right]\right]

BALD 以候選標籤與模型參數之間的互信息為每個樣本評分,獲取最能「教會」模型的資料點。

在大規模下,批次取得比一次只挑一個點更重要:你必須選出一個多樣的批次,使這些標籤彼此不近似重複。這正是估值與取得融合之處——價值告訴你過去什麼有幫助、取得預測接下來什麼會有幫助,而一個多樣性項讓批次不致塌縮到單一個模稜兩可的群集上。

順序很重要:資料上的課程

即使集合固定,呈現的順序也會改變結果。課程式資料排序(curriculum data ordering)把樣本由易到難(或依另一種能力訊號)排程,讓訓練早期先建立穩定特徵、再去處理模稜兩可的案例——這是課程學習(curriculum learning)策略在資料層面的表親。在大型預訓練中,它表現為分階段:以廣泛、乾淨的網路文本起步,在訓練尾段把權重移向高品質、領域密集或近指令式的資料。

\min_{w,\;v\in[0,1]^{n}}\;\sum_{i=1}^{n} v_i\,\ell_i(w)\;-\;\frac{1}{K}\sum_{i=1}^{n} v_i,\qquad v_i^{\star}=\mathbf{1}\!\left[\ell_i(w)<K\right]

自步學習把由易到難的順序顯式化:步調閾值 K 只在樣本 i 的損失低於 K 時納入它,並隨訓練逐步放大。

長尾是模型失敗之處

平均準確率掩蓋了長尾(long tail):罕見類別、不尋常的方言、個別少見但合起來構成真實失敗多數的邊緣現象。以資料為中心的工具箱直接攻擊長尾——對罕見案例做針對性的取得、重新加權或重新採樣、對代表性不足之模態做合成擴增,並保護長尾免於被過度激進的品質過濾器與修剪當成雜訊刪掉。

w_y=\frac{1-\beta}{\,1-\beta^{\,n_y}\,},\qquad \mathcal{L}_{\mathrm{CB}}=-\,w_y\,\log p(y\mid x)

類別平衡重加權對抗長尾:每個類別按其有效樣本數的倒數加權,使稀有類別的權重更大。

照顧長尾同時也是一種分布偏移(distribution shift)策略:明天的常見案例往往是今天的長尾。一個持續取得並標註新興罕見案例的資料引擎,實際上是在偏移於你的指標上現形之前,就追蹤著這個移動的目標。

文件化、治理,閉合飛輪

若沒有人能稽核,這一切都不可信。資料卡(data cards,datasheets、data statements)記錄來源、組成、蒐集流程、所套用的過濾與去重、已知偏差,以及預期用途。它們把一團不透明的資料變成可被審閱的產物,也日益成為同意與治理(consent and governance)合規所必需,更是讓未來團隊能重現或質疑你流程的依據。

  1. 部署並監測新的失敗群集與新興的長尾案例。
  2. 用人類在環的判準,為那些案例取得多樣、高價值的標籤。
  3. 清理並評估新資料,再重新配比、重排課程並重訓。
  4. 更新資料卡與汙染報告,讓這份產物持續可稽核。
資料引擎是一個閉環飛輪:監控、獲取、清洗、評估、混合、記錄、再訓練,由漂移回饋驅動下一輪迭代。

MLOps 生命週期示意圖,含從監控回饋回資料獲取與再訓練的閉環。