因果推論與機器學習
雙重機器學習(DML)
你很想用一個彈性學習器去吸收幾十個混淆因子,但把一個正則化模型直接塞進效應估計裡會毒害它:那個為了幫助預測而設計的模型偏誤,會滲進因果數字裡。雙重機器學習就是一套紀律,讓你既能保留彈性學習器,又能還原一個一階無偏、以慣常的根號 n 速率收斂、且帶有有效信賴區間的效應估計。
兩個想法在背後運作。第一是 Neyman 正交性:把估計方程重塑,使它對 nuisance 函數(結果模型與傾向模型)小誤差的敏感度在一階上消失,於是中等不準的學習器並不會撼動效應。在部分線性模型裡,這表現為殘差對殘差的迴歸——用共變量去預測處置與結果,再把兩個學習器各自無法解釋的部分關聯起來。第二是交叉擬合(cross-fitting):nuisance 在一份資料摺上擬合、效應在另一份摺上評估,移除否則會悄悄爬回來的過度擬合偏誤。
回報是一座連接現代預測與古典推論的有原則的橋:任何夠準的學習器都能充當 nuisance 估計器,而目標參數仍保有母數速率的保證。假設依舊是因果的、而非魔法的——無混淆、重疊,以及收斂得夠快(快於 n 的四次方根)的 nuisance 學習器。
\hat\theta:\;\mathbb{E}\!\left[\big(Y-\hat m(X)\big) - \theta\big(T-\hat e(X)\big)\,\big|\,(T-\hat e(X))\right]=0
部分線性 DML:把結果殘差對處置殘差迴歸,nuisance m 與 e 以機器學習加交叉擬合來估計。
正交性消去一階 nuisance 偏誤,卻不免除『nuisance 必須收斂』的要求;若學習器太慢,根號 n 的保證就會失效。
又称
另见