以資料為中心的人工智慧
訓練資料歸因(training-data attribution)
訓練資料歸因問的是一般可解釋性的反面:不是哪些輸入特徵驅動了這個預測,而是哪些訓練樣本驅動了它。給定一個模型行為——某個特定答案、一段被記住的句子、一個偏誤——訓練資料歸因把它追溯回最該負責的少數幾份訓練文件,讓你能稽核、除錯或歸功於資料。它是影響函數以及幾個更便宜、更可擴展的近親之上的實務統稱。
各方法在保真度與成本間取捨。黃金標準是經驗式的:在隨機資料子集上重訓許多模型,再把每個樣本是否在場對該行為做迴歸(datamodels),昂貴但忠實。梯度相似度法(TracIn)沿最佳化軌跡累積測試梯度與各訓練點梯度的內積來歸因,便宜且以檢查點為基礎。隨機投影法(TRAK)在訓練好的參數附近把模型線性化,並用梯度的 Johnson–Lindenstrauss 草圖以零頭成本近似 datamodel。三者都為某個查詢,對每個訓練樣本產生一個歸因分數。
訓練資料歸因日益成為著作權爭議、語言模型事實溯源、以及辨識「哪些資料引發了某個失敗」的核心。它的限制與影響函數如出一轍:軌跡與線性化假設讓分數只是近似,且歸因在不同訓練種子間可能不穩定。
datamodels 是忠實但昂貴的真值;TracIn 與 TRAK 是可擴展的近似,能驗證時就拿它對齊。
又称
另见