JOVANA
Explore Library Glossary Getting Started Three Levels Fields How it works Mission
Join the mission
All guides

自然實驗與準實驗設計

當你無法隨機分派時,世界有時會替你隨機分派。差異中之差異、迴歸不連續、作為設計的工具變數,以及把效應轉化為以增益為導向的目標投放。

用設計換取識別

黃金標準是隨機實驗——一場 A/B 測試——因為隨機分派在構造上就切斷了每一條後門路徑。但實驗往往不可行、不合倫理、或太慢。準實驗(quasi-experimental)設計利用真實世界中處置如何被分派的「意外」來逼近那份隨機性。其藝術在於找到一個情境,使得在該設計的假設下,處置近乎隨機,然後明確地倚靠那些假設,而不是寄望一條迴歸式能把混淆理清。

差異中之差異

差異中之差異(difference-in-differences, DiD)是以追蹤資料或重複橫斷面資料做政策評估的主力。一個處置組在某時點採行了某項介入;一個對照組則始終沒有。把處置組的前後變化與對照組的前後變化相比,會差除掉兩組之間任何固定、不隨時間變動的差距,以及同時打到兩組的任何共同衝擊。關鍵假設是平行趨勢(parallel trends):若沒有處置,兩組的結果本來會平行地移動。

\hat{\tau}_{\text{DiD}} = \big(\bar{Y}^{\,\text{post}}_{\text{treat}} - \bar{Y}^{\,\text{pre}}_{\text{treat}}\big) - \big(\bar{Y}^{\,\text{post}}_{\text{ctrl}} - \bar{Y}^{\,\text{pre}}_{\text{ctrl}}\big)

2×2 双重差分估计量:用处理组的前后变化减去对照组的前后变化,抵消共同的时间趋势。

迴歸不連續

迴歸不連續設計(regression discontinuity design, RDD)利用一條硬性的門檻規則。獎學金發給分數高於 80 的學生;補助發給規模低於某截斷值的廠商。在截斷值的稍上稍下,各單位在除了處置以外的一切上幾乎完全相同——門檻扮演了一個局部的隨機分派器。藉由比較截斷值附近狹窄區間內的結果,RDD 識別出一個明確的局部效應:恰好位於邊界上之單位的效應。它的可信度之所以高,正因為比較如此局部;它的限制則是該估計值未必能外推到遠離門檻之處。

\tau_{\text{RDD}} = \lim_{x \downarrow c}\, \mathbb{E}[\,Y \mid X = x\,] - \lim_{x \uparrow c}\, \mathbb{E}[\,Y \mid X = x\,]

清晰断点回归把因果效应识别为运行变量在临界值 c 处结果的跳跃。

野外的工具變數

自然實驗常常免費把一個工具變數(instrumental variable)送到你手上:兵役抽籤、作為供給移動因子的天氣、按地理交錯推行的政策。工具把外生的變異注入處置中,而兩階段最小平方法可復原順從者(compliers)的效應——也就是處置狀態確實會回應該工具的那群人。這是一個局部平均處置效應,而說清楚你估到的是誰的效應,與那個數字本身同等重要。

\tau_{\text{LATE}} = \frac{\operatorname{Cov}(Y, Z)}{\operatorname{Cov}(D, Z)} = \frac{\mathbb{E}[Y \mid Z = 1] - \mathbb{E}[Y \mid Z = 0]}{\mathbb{E}[D \mid Z = 1] - \mathbb{E}[D \mid Z = 0]}

瓦尔德(工具变量)估计量:工具变量对结果的影响除以其对处理的影响,识别依从者的局部效应。

從效應到行動:增益模型

估計效應是手段;行動得當才是目的。增益模型(uplift modeling)預測一項介入對個體的增量效應——本質上是為目標投放而重新包裝的 CATE——並依「處置會多大程度改變某人結果」來排序,而非依結果發生的可能性。經典的四象限頗具啟發:可說服者只有在受處置時才回應,鐵定者無論如何都會回應,無望者怎樣都不回應,而睡狗則實際上會被處置所傷害。只在可說服者身上花成本、絕不碰睡狗,價值就在這裡。

\tau(x) = \mathbb{E}\big[\,Y(1) - Y(0) \mid X = x\,\big]

增益模型的目标是条件平均处理效应——给定特征 x 时干预的个体增量效应。