因果推論與機器學習
迴歸不連續設計(RDD)
許多規則以一道明確的分界線分配好處:分數高於某值給獎學金,所得低於某線給補助。緊貼這條線兩側的人本質上幾乎一模一樣,差別只在一個偶然——他們落在門檻的哪一邊。迴歸不連續設計把這道刀鋒當成一個微型的自然實驗,從『恰在門檻處結果的跳躍』讀出因果效應。
設一個執行變數(running variable)X,當它越過門檻 c 時指派處置。在精確(sharp)設計中,處置在 c 處確定性地切換,局部效應就是結果對 X 的迴歸從上方與從下方逼近 c 時兩個極限之差。在模糊(fuzzy)設計中,越過 c 只改變接受處置的機率,於是把結果的跳躍除以處置機率的跳躍——這是一個工具變數的手法。估計使用 c 附近、由資料決定頻寬內的局部線性迴歸,在偏誤與變異之間取得平衡。
它的可信度來自一個溫和、部分可檢驗的假設:除了處置之外的一切都平滑地穿過門檻,因此個體無法精確操弄自己落在哪一邊(McCrary 密度檢定可探查這點)。代價是外部效度——RDD 只識別門檻附近個體的效應,這是一個局部平均處置效應,未必能延伸到遠離邊界的人身上。
\tau_{RDD} = \lim_{x\downarrow c}\mathbb{E}[Y\mid X=x] - \lim_{x\uparrow c}\mathbb{E}[Y\mid X=x]
精確 RDD 效應是期望結果在指派門檻 c 處跳躍的大小。
又称
另见