以資料為中心的人工智慧
影響函數歸因(influence functions for attribution)
影響函數不必重訓就能回答一個反事實:如果我把這一個訓練點加重(或移除),某個特定預測會如何改變?相較於代價極高的逐一留一重訓,古典統計給出一階近似——對訓練點的權重做無窮小擾動,再透過模型的最適條件追蹤其影響。它把「哪些訓練資料該為這個輸出負責」變成一個微積分問題。
這個估計透過訓練損失的逆 Hessian,把兩個梯度結合起來:測試損失的梯度與該訓練點損失的梯度。Hessian 捕捉損失地形在最適點的曲率,因此逆 Hessian 與向量的乘積,把一個局部推動轉換成參數的全域變化,進而轉成測試預測的變化。由於對大模型構造並反轉 Hessian 不可行,實務上採用隨機估計(LiSSA)、Kronecker 分解(EK-FAC)近似,或 Arnoldi 迭代;近期工作已將其擴展到大型語言模型。
提醒很尖銳:一階理論假設一個嚴格凸的最適點,因此對深層非凸網路,估計只是近似、有時還很脆弱,而 Hessian 近似同時主宰了成本與誤差。儘管如此,影響函數仍是尋找標錯資料、解釋預測與稽核記憶的領先工具。
\mathcal{I}_{\mathrm{up,loss}}(z, z_{\mathrm{test}}) = -\,\nabla_\theta L(z_{\mathrm{test}}, \hat{\theta})^{\top} \, H_{\hat{\theta}}^{-1} \, \nabla_\theta L(z, \hat{\theta})
加重訓練點 z 對 z_test 測試損失的影響,透過訓練損失的逆 Hessian H 傳遞。
影響函數是一階、假設凸最適點的近似——在深層網路上,把它的排序讀作提示,而非精確的反事實。
又称
另见