[论文解读] Patterns of Effects and Sensitivity Analysis for Differences-in-Differences
本文提出了一种差异中的差异(DID)设计的敏感性分析方法,量化了需要多少未观测到的混杂因素才会推翻因果结论。通过结合匹配以控制可观测协变量,并采用基于麦克内马尔统计量的新型敏感性检验,作者表明即使与平行趋势假设存在微小偏差(例如治疗分配几率变化5%),也可能导致结论反转,凸显了在缺乏稳健性检验的情况下,标准DID推论的脆弱性。
Applied analysts often use the differences-in-differences (DID) method to estimate the causal effect of policy interventions with observational data. The method is widely used, as the required before and after comparison of a treated and control group is commonly encountered in practice. DID removes bias from unobserved time-invariant confounders. While DID removes bias from time-invariant confounders, bias from time-varying confounders may be present. Hence, like any observational comparison, DID studies remain susceptible to bias from hidden confounders. Here, we develop a method of sensitivity analysis that allows investigators to quantify the amount of bias necessary to change a study's conclusions. Our method operates within a matched design that removes bias from observed baseline covariates. We develop methods for both binary and continuous outcomes. We then apply our methods to two different empirical examples from the social sciences. In the first application, we study the effect of changes to disability payments in Germany. In the second, we re-examine whether election day registration increased turnout in Wisconsin.
研究动机与目标
- 解决尽管控制了时间不变偏差,差异中的差异(DID)估计仍易受未观测到的时间变动混杂因素影响的问题。
- 开发一种敏感性分析方法,量化使研究因果结论反转所需的隐藏混杂程度。
- 将该方法应用于两个现实政策评估:德国残疾津贴调整和美国选举日投票登记(EDR)。
- 表明常规DID推论可能因低估不确定性而高估统计显著性,尤其是在假设平行趋势但未加以验证时。
- 强调DID应被视为一种统计工具,而非自然实验,其合理性取决于对治疗分配机制的建模以及对未观测混杂因素的敏感性评估。
提出的方法
- 使用卡迪纳利蒂匹配,在可观测基线协变量(如年龄、种族、教育程度、收入)上创建平衡的处理组与对照组,确保各时间周期间协变量平衡。
- 在时间之间进行成对匹配,将1972年和1980年的匹配对关联起来,保持平衡并支持组内比较。
- 采用基于优势比Γ²的敏感性分析框架,评估使DID估计反转所需的未观测混杂程度。
- 使用麦克内马尔检验检验精确零假设,计算在不同未观测混杂水平(Γ)下的单侧p值。
- 计算Γ的临界点值,即p值越过传统0.05阈值的点,表示结论将发生反转的临界点。
- 将该方法扩展至二值和连续结果,提升其在社会科学实证研究中常见情境下的适用性。
实验结果
研究问题
- RQ1为使关于EDR是否提高威斯康星州投票率的结论反转,需要多少未观测到的混杂因素?
- RQ2德国残疾津贴削减对服务使用影响的DID估计,在平行趋势假设被违反时,其稳健性如何?
- RQ3基于优势比的敏感性分析能否检测出可能使标准DID推论失效的隐藏混杂因素?
- RQ4与基于回归的调整相比,匹配的使用如何提升DID估计的稳健性?
- RQ5使DID估计的统计显著性失效的未观测混杂程度(以Γ衡量)的临界水平是多少?
主要发现
- 在EDR应用中,传统DID估计显示威斯康星州投票率比伊利诺伊州高出10.3个百分点,p < .001,表明具有很强的统计显著性。
- 然而,敏感性分析显示,治疗分配几率仅变化5%(Γ ≈ 1.05)就会使单侧p值超过0.05,表明结论对微小未观测混杂因素极为敏感。
- 使用麦克内马尔统计量检验精确零假设的p值为0.018,表明对零假设存在强有力证据,但该结果对未观测混杂因素高度敏感。
- 传统t检验低估了不确定性,导致对DID估计显著性的过度自信,尤其在未验证平行趋势假设时更为明显。
- 该方法表明,即使与平行趋势存在微小偏差(如治疗分配几率变化5%),也可能导致结论反转,凸显了敏感性分析的必要性。
- 作者得出结论:DID不应被视为自然实验,而应视为一种依赖于治疗分配机制建模及对未观测混杂因素敏感性评估的统计工具。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。