因果推論與機器學習

不變風險最小化(IRM)

標準訓練會獎勵任何能降低誤差的特徵,包括像『背景剛好與標籤相關』這種虛假捷徑。不變風險最小化試圖對這類捷徑免疫,方法是要求模型只依賴那些『與標籤的關係在不同訓練環境間維持不變』的特徵——其直覺是:一個穩定的、因果的關係到處都成立,而一個虛假的關係會隨環境改變而偏移。

具體而言,IRM 尋找一種資料表徵,使得疊在它之上的單一線性預測器在每個環境裡同時是最佳的。由於這個雙層條件難以最佳化,實用目標 IRMv1 在慣常的平均風險之外,加上一個梯度懲罰項,把各環境的最佳分類器推向同一個常數。如此一來,在某個環境有預測力、卻在各環境間不不變的特徵就會被懲罰,原則上留下一個依靠因果結構、而非偶然結構的預測器。

IRM 是把『機制不變、混淆不不變』這個因果想法操作化的里程碑式嘗試,將它與分布外泛化及領域穩健性連結起來。它也持續受到爭議:後續研究顯示,這個放鬆後的目標可能無法還原不變預測器、可能需要多到不切實際或夠多樣的環境,有時還輸給仔細做的經驗風險最小化,因此最好把它看成一個肥沃的研究方向,而非已解決的配方。

又稱
IRM不變風險最小化