[论文解读] Confounding and Regression Adjustment in Difference-in-Differences
本文通过提出同时考虑时不变和时变协变量的回归调整策略,解决了差异中的差异(diff-in-diff)研究中时变混杂的问题。通过模拟研究证明,正确设定的回归模型——尤其是包含时间×协变量交互项的模型——能有效减少偏差并恢复无偏的因果估计,优于标准模型和匹配方法。
Difference-in-differences (diff-in-diff) is a study design that compares outcomes of two groups (treated and comparison) at two time points (pre- and post-treatment) and is widely used in evaluating new policy implementations. For instance, diff-in-diff has been used to estimate the effect that increasing minimum wage has on employment rates and to assess the Affordable Care Act's effect on health outcomes. Although diff-in-diff appears simple, potential pitfalls lurk. In this paper, we discuss one such complication: time-varying confounding. We provide rigorous definitions for confounders in diff-in-diff studies and explore regression strategies to adjust for confounding. In simulations, we show how and when regression adjustment can ameliorate confounding for both time-invariant and time-varying covariates. We compare our regression approach to those models commonly fit in applied literature, which often fail to address the time-varying nature of confounding in diff-in-diff.
研究动机与目标
- 澄清差异中的差异(diff-in-diff)研究中混杂因子的定义,将其与横断面设计中的传统混杂区分开来。
- 识别随时间变化的协变量若在处理组之间存在差异并影响结果趋势,如何违反平行趋势假设。
- 开发并评估在差异中的差异模型中正确调整时不变和时变混杂因子的回归策略。
- 在存在混杂的情况下,比较回归调整与常用模型及匹配技术的表现。
- 为应用研究人员提供关于模型设定和协变量纳入的方法论指导,以确保差异中的差异研究中有效的因果推断。
提出的方法
- 将差异中的差异中的混杂因子定义为在处理组之间存在差异且与结果趋势相关联的协变量,而不仅仅是与处理或结果本身相关。
- 将平行趋势假设形式化为处理组与对照组之间未处理潜在结果的期望变化相等。
- 提出包含时间与协变量交互项(TVA模型)的回归模型,以调整时变混杂。
- 使用模拟研究比较回归模型(CA与TVA模型)与标准差异中的差异和匹配方法在偏差与精度方面的表现。
- 在不同情景下评估模型表现,包括时不变和时变混杂因子导致组间趋势分化的场景。
- 强调基于实质性知识的模型设定,倡导模型完全透明,并在补充材料中包含分析代码。
实验结果
研究问题
- RQ1在差异中的差异研究中,什么构成混杂因子?它与横断面设计中的混杂有何不同?
- RQ2随时间变化的协变量若在不同处理组中演变方式不同,如何影响平行趋势假设的有效性?
- RQ3在何种条件下,通过时间×协变量交互项进行回归调整可减少差异中的差异估计的偏差?
- RQ4在偏差与效率方面,基于回归的调整策略与标准差异中的差异模型及匹配方法相比表现如何?
- RQ5当存在时变混杂时,研究人员应遵循哪些模型设定原则以确保有效的因果推断?
主要发现
- 若未适当地调整,随时间变化且在处理组之间存在差异并影响结果趋势的混杂因子,会严重偏差标准差异中的差异估计。
- 包含时间与协变量交互项的回归模型(TVA模型)在存在时变混杂的情境下显著减少偏差,尤其在处理后趋势分化的场景中表现更优。
- 未考虑时变混杂的标准差异中的差异模型会产生显著偏差,尤其在协变量在处理后以不同方式演变的场景中。
- 在存在时变混杂的情况下,匹配方法始终表现出显著偏差,尤其在协变量于处理后发生变化时。
- 正确设定的回归模型即使在无混杂的情况下也能提高估计效率,且相较于某些匹配方法更不易出现回归至均值的问题。
- 所提出的回归策略在不同数据结构(包括面板数据和重复横截面数据)中均表现稳健,且不局限于特定模型类型。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。