以資料為中心的人工智慧

程式化標註(programmatic labeling)

與其付錢請人標註每個樣本,程式化標註讓領域專家寫規則——關鍵字啟發式、正規表達式、本體查表、呼叫其他模型——每條規則為部分資料猜一個標籤。每條規則都是一個有雜訊、不完整的標註函式:它可能標錯、可能棄權、也可能與其他規則相關。目標是把許多這種薄弱、便宜的訊號合成出大規模的準確訓練標籤,把專家直覺變成監督,而不必逐列人工標註。

核心機制是一個標籤模型,它僅憑各標註函式之間的一致與不一致——沒有真實標籤——就估計出每條函式的準確率與它們的相關結構,通常透過一個對「潛在真實標籤與觀測投票」的生成模型,以矩陣補全或對函式輸出共變異數做動差法求解。接著它依每條函式的估計可靠度加權,為每個樣本輸出一個機率式(軟)標籤。下游的判別式模型在這些軟標籤上訓練,能泛化到超出規則涵蓋的範圍,學到啟發式從未指名的特徵。

Snorkel 系列工作讓這套方法普及。提醒是:若多條標註函式共享一個相關的盲點,標籤模型可能會自信地出錯;而各函式的準確率,只有在對相依結構做出結構性假設下才可識別。

標籤模型僅憑一致性樣式就能還原各函式準確率——但前提是你正確建模了哪些函式彼此相關。

又称
weak supervisiondata programmingSnorkel程式化標註