以資料為中心的人工智慧

可信學習(confident learning)

可信學習是一種在不知道真實標籤的情況下,找出資料集中標錯樣本的方法——做法是讓模型自己「很有把握的錯誤」露出馬腳。直覺是:用交叉驗證訓練分類器,讓每個樣本都拿到一個樣本外的預測機率,然後找出那些模型有信心地認為「屬於別的類別」、卻與其寫定標籤不符的樣本。這些就是標籤錯誤的頭號嫌疑犯。

形式上,它估計「觀測到的雜訊標籤」與「潛在真實標籤」之間的聯合分布。每個樣本都有預測機率;你為每個類別設一個信心門檻(該類別的平均自我信心),只有當某樣本對某類的預測機率超過該類門檻時,才把它計入對應的混淆格。把這些計數彙總並校準,就得到雜訊對真實的聯合矩陣估計,據此把樣本依「被估為標錯的機率」排序,再剪除或重標最糟的那些。關鍵是它與模型無關,且假設的是類別條件式雜訊,而非均勻翻轉。

它能擴展到大型資料集,並支撐了 cleanlab 等工具,但它也繼承了模型的盲點:若分類器與標註者共享同一套系統性偏誤,這種錯誤就偵測不到;而過度剪除也可能刪掉真正困難但正確的樣本。

\hat{Q}_{\tilde{y}, y^{*}}[i][j] = \frac{|\hat{X}_{\tilde{y}=i, y^{*}=j}|}{\sum_{i,j} |\hat{X}_{\tilde{y}=i, y^{*}=j}|}

雜訊標籤 ỹ 與真實標籤 y* 的聯合估計;非對角線的質量就是標籤錯誤的總量。

可信學習找的是標籤錯誤而非困難樣本——下門檻前先做校準,否則過度自信的模型會標錯列。

又稱
CLcleanlab可信學習