因果推論與機器學習
潛在結果框架(Rubin 因果模型)
對每個個體想像兩個平行世界:它若接受處置會出現的結果,以及它若未接受處置會出現的結果。潛在結果框架一開始就把這兩個量命名出來,把兩者之差稱為這個個體的因果效應,然後正面面對一個惱人的事實——你永遠只觀察得到其中一個。這個『因果推論的根本問題』把效應估計重新框成一個系統性遺漏資料的填補問題。
每個個體帶著一對 Y(1)、Y(0);實際觀察到的結果是 Y = T*Y(1) + (1 - T)*Y(0),其中 T 是處置指標。要從資料還原平均效應,通常得援引兩個假設:SUTVA(某個體的處置不會改變另一個體的結果,且處置只有單一版本)以及可忽略性/無混淆(在給定已測共變量下,處置與潛在結果獨立)。在這些條件下,對共變量取條件能讓處置組與控制組可比,效應也就可估。
這個框架是統計與計量經濟學的通用語言,且能乾淨地對應到結構因果模型:反事實 Y(t) 就是 SCM 在 do(T=t) 下產生的結果。它的紀律在於逼著你把每一個關於遺漏反事實的假設攤在陽光下,讓人能對它辯論,而不是把它藏起來。
\tau_i = Y_i(1) - Y_i(0),\qquad Y_i = T_i Y_i(1) + (1-T_i) Y_i(0)
個體效應是兩個潛在結果之差;第二式中每次只觀察得到其中一項。
可忽略性是關於未測混淆的假設,不是資料能證實的性質;更豐富的共變量讓它更可信,卻永遠無法證明它。
又称
另见