以資料為中心的人工智慧
資料 Shapley 估值(data Shapley valuation)
一個訓練樣本值多少錢?資料 Shapley 借用合作賽局理論中的公平分配概念來回答:把訓練點想成一群玩家,他們合力賺到一份報酬(模型準確率),然後把功勞這樣分——每個點拿到它「在所有可能加入的聯盟中」的平均邊際貢獻。一個加進去後總是穩定提升表現的點得高值;冗餘或有害的點則得低值甚至負值。
點 i 的 Shapley 值,是對所有不含 i 的子集 S,把 i 加進 S 所帶來的表現增益取平均。這是唯一同時滿足效率性、對稱性、虛玩家性與可加性的功勞分配。麻煩在於精確總和要跑遍指數多個子集,因此實務上只能估計:對隨機排列做截斷蒙地卡羅、以梯度或影響函數為基礎的近似,或更便宜、且有精確閉式解的 K 近鄰 Shapley。這些值是相對於某個學習演算法與某個保留集指標而定義的,因此並非資料本身的內在屬性。
它被用來為資料定價、偵測標錯或投毒的點(這些會拿到負值),並引導資料取得。誠實的限制是:估值有雜訊、昂貴、且在不同重訓種子下不穩定,而且一個點的價值完全取決於有哪些其他資料同時在場。
\phi_i = \sum_{S \subseteq D \setminus \{i\}} \frac{|S|!\,(n-|S|-1)!}{n!} \,\big[ v(S \cup \{i\}) - v(S) \big]
點 i 的值,是它在所有聯盟 S 上的邊際增益 v(S∪{i})−v(S) 的加權平均,權重讓每種聯盟大小等量計入。
資料 Shapley 為負,是強烈的標錯或投毒訊號——這個點「被移除」才有價值。
又称
另见