以資料為中心的人工智慧
資料品質指標(data quality metrics)
如果模型的好壞取決於它吃進去的資料,那麼資料品質指標就是上菜前對食材做的化驗。與其盯著上百萬列資料憑感覺,不如算出幾個數字,告訴你標籤有多吵、這些樣本實際涵蓋了多少輸入空間、以及兩個幾乎相同的輸入有多常拿到互相矛盾的標籤。這些數字把「這份資料好像很亂」的模糊感受,變成可以追蹤、跨版本比較、並用來設發布門檻的東西。
具體上這一族分成三個軸。標籤雜訊估計有多少比例的樣本,其給定標籤與真實標籤不符,常透過交叉驗證的模型一致性,或標註者間的信度統計(如 Cohen's 或 Fleiss' kappa)來估。涵蓋度量測樣本如何填滿特徵流形與標籤分布:嵌入空間中的密度、類別平衡、以及那些部署時會看到、但訓練集從未示範過的輸入缺口。一致性量測自我矛盾,也就是等價或近重複的輸入卻帶不同標籤的比率,它構成可達準確率的上界。
誠實的提醒是:以上沒有一個就是你真正在乎的目標——下游任務表現。一份資料可能在每個代理指標上都漂亮,卻因為抽樣到錯誤的母體而完全不適用於你的應用。請把品質指標當成分流與監控層,而不是保證書。
kappa 偏低往往代表任務本身定義模糊,而非標註者差——先修標註準則,再檢討人。
又稱
另見