Skip to main content
QUICK REVIEW

[论文解读] Efficient Difference-in-Differences Estimation with High-Dimensional Common Trend Confounding

Michael Zimmert|arXiv (Cornell University)|Sep 5, 2018
Advanced Causal Inference Techniques参考文献 34被引用 7
一句话总结

本文通过推导半鞅效率影响函数,在高维共同趋势混淆下开发了高效、双 robust 的双重差分(DiD)模型估计量。该方法使第一阶段的扰动估计可使用机器学习方法,同时保持渐近有效性与效率,即使协变量为高维或与结果呈非线性关系。

ABSTRACT

This study considers various semiparametric difference-in-differences models under different assumptions on the relation between the treatment group identifier, time and covariates for cross-sectional and panel data. The variance lower bound is shown to be sensitive to the model assumptions imposed implying a robustness-efficiency trade-off. The obtained efficient influence functions lead to estimators that are rate double robust and have desirable asymptotic properties under weak first stage convergence conditions. This enables to use sophisticated machine-learning algorithms that can cope with settings where common trend confounding is high-dimensional. The usefulness of the proposed estimators is assessed in an empirical example. It is shown that the efficiency-robustness trade-offs and the choice of first stage predictors can lead to divergent empirical results in practice.

研究动机与目标

  • 解决传统参数方法失效的高维共同趋势混淆下双重差分(DiD)模型的挑战。
  • 在不同模型假设下推导半鞅效率界限与影响函数,揭示稳健性与效率之间的权衡。
  • 在保持渐近性质的前提下,使灵活的机器学习方法可用于第一阶段扰动估计(如结果模型与倾向得分模型)。
  • 表明估计量性能对第一阶段预测变量与得分函数的选择极为敏感,尤其在小样本中。
  • 通过比较不同建模假设下的效率、稳健性与实证表现,为估计量选择提供实用指导。

提出的方法

  • 在处理处理组、时间与协变量联合分布的不同假设下,推导 DiD 模型的高效影响函数。
  • 基于 [37, 38] 与 [9] 的半鞅理论,建立效率界限,并在弱正则性条件下构造达到该界限的估计量。
  • 应用双重机器学习框架,将高效影响函数与高维、灵活的第一阶段估计量(如集成学习器)结合。
  • 采用交叉拟合以确保推断有效性,并在高维设定中降低偏差。
  • 通过虚假检验与蒙特卡洛模拟,评估模型误设与不同数据结构下估计量的表现。
  • 在四种不同模型设定(CS-1 至 CS-4)下比较估计量,涵盖协变量进入模型方式与面板数据 vs. 横截面数据可用性的不同假设。

实验结果

研究问题

  • RQ1模型假设(特别是协变量作用)的选择如何影响 DiD 模型中的半鞅效率界限?
  • RQ2能否为具有高维混淆的 DiD 模型推导高效影响函数?它们是否能实现使用机器学习的稳健、高效估计?
  • RQ3在对数据生成过程施加更强或更弱假设时,估计效率与稳健性之间的权衡如何?
  • RQ4不同第一阶段估计量(如参数模型 vs. 集成学习器)如何影响 DiD 估计量的有限样本表现与标准误?
  • RQ5在具有高维混淆的 DiD 设定中,面板数据相比横截面数据在多大程度上能提升效率?

主要发现

  • 半鞅效率界限对模型假设极为敏感,揭示出明确的稳健性-效率权衡:更强假设可获得更低的方差界限。
  • 在不同假设下推导出的高效影响函数,可产生在弱第一阶段收敛条件下具有速率双 robust 性与渐近正态性的估计量。
  • 基于集成学习器(如 Super Learner)的估计量在引入更多协变量时表现稳定、高效,且常不显著,表明信息被有效利用。
  • 相比之下,参数第一阶段模型(如线性/逻辑回归)在协变量集扩大时即使使用交叉拟合,仍可能产生发散或极端结果。
  • 得分函数的选择(如高效 vs. 稳健)显著影响标准误:例如,设定 (CS-4) 中的得分函数导致标准误明显高于高效得分函数。
  • 虚假检验表明,仅使用集成学习器的估计量保持可信性与稳定性,凸显了实践中第一阶段预测质量的重要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。