數據與特徵

以資料為中心的AI(data-centric AI)

/ DAY-tuh-SEN-trik AY-EYE /

多年以來,改進一個AI系統的辦法,是去擺弄模型——試試更花哨的架構、多調幾個旋鈕、多加幾層——而把資料集當作一個你只能將就的、固定不變的東西。以資料為中心的AI顛倒了這個優先次序。它讓模型保持不動,轉而系統性地去改進資料:修正錯誤的標籤、補上缺口、去除重複、為模型搞砸的那些情形添加例子。它的口號是:更好的資料,常常勝過更好的模型。

具體說來,一套以資料為中心的工作流,會去尋找模型在哪裡失敗,把這些失敗追溯回資料,再去修資料:糾正標錯的例子、讓標註規範保持一致、為被低估的情形採集更多資料,並像衡量模型準確率那樣審慎地衡量資料品質。這個說法由吳恩達(Andrew Ng)在2021年前後推廣開來,作為對這一領域長期沉迷於「更大更聰明的模型」的一個有意為之的制衡。

為何重要:在許多真實專案裡,資料集比模型更雜亂、也更具影響力,卻得到了遠更少的關注。清洗標籤、修補覆蓋缺口,往往能比更換演算法帶來更大、更可靠的提升——在資料有限時尤其如此。一個誠實的告誡是:這是一種側重點的轉移,而非靈丹妙藥——資料和模型都重要,正確的做法通常是去改進當下那個最薄弱的環節,而不是把其中之一奉為王者。

一個缺陷檢測模型卡在了76%。團隊沒有去嘗試新架構,而是審查了資料,發現檢驗員們對「刮痕」的認定標準並不一致。他們重寫了標註規範、一致地重新標註,準確率隨即躍升到了90%——而模型一模一樣。問題的解藥,自始至終都在資料裡。

同一個模型,修好標籤:14個百分點的提升,任何架構都買不來。

以資料為中心的AI是對精力分配的一次再平衡,而非宣稱模型無關緊要。實踐中,你要改進的是當下最薄弱的那一環——而出人意料地,那一環常常正是資料。

又稱
data-centric machine learning以数据为中心的人工智能数据中心AI以資料為中心的人工智慧資料中心AI