以資料為中心的人工智慧

主動資料取得(active data acquisition)

標籤要花錢,所以別亂買——買那些最能教會模型的。主動資料取得是這樣一個循環:當前模型指出哪些未標註樣本一旦標了最能提升自己,一個神諭(常是人類)只標那些,模型重訓,循環再來。有了好的取得規則,你能用隨機預算所需的一小部分標籤,就達到目標準確率。

取得函式以不同方式編碼「最有資訊量」。不確定性抽樣挑模型最沒把握的樣本(最小邊際、最高預測熵)。委員會查詢挑集成最不一致之處。貝氏方法(BALD)挑能最大化「對參數之期望資訊增益」的樣本,把模型不確定性與資料雜訊區分開。多樣性與涵蓋度方法(core-set、BADGE,後者結合梯度大小與 k-means++ 多樣性)對抗一種失敗模式:純不確定性會在同一批中選出冗餘、近乎相同的困難樣本。每一輪的輸出是一批送去標註的資料。

誠實的難處是:取得本身是有偏抽樣,因此標註集非獨立同分布,直接在它上面評估會過度樂觀;初始模型太弱的冷啟動會誤導分數;而當資料池與部署之間有分布偏移時,增益會縮水。

純不確定性抽樣會在一批中選出冗餘的近重複樣本——加上多樣性項(BADGE、core-set),否則浪費預算。

又称
active learningdeep active learning主動資料取得