Skip to main content
QUICK REVIEW

[论文解读] Theory for identification and Inference with Synthetic Controls: A Proximal Causal Inference Framework

Xu Shi, Li, Kendrick|arXiv (Cornell University)|Aug 31, 2021
Advanced Causal Inference Techniques参考文献 44被引用 8
一句话总结

本文提出了一种用于合成控制的近端因果推断框架,利用未使用的控制单元作为潜在混杂因素的代理变量,即使在前期拟合效果较差的情况下,也能实现合成控制权重和处理效应的一致估计。该框架在非线性模型和时间序列方法下形式化了识别与推断,展示了对序列相关性和非平稳因子的鲁棒性,并在德国统一的研究中得到验证。

ABSTRACT

Synthetic control (SC) methods are commonly used to estimate the treatment effect on a single treated unit in panel data settings. An SC is a weighted average of control units built to match the treated unit, with weights typically estimated by regressing (summaries of) pre-treatment outcomes and measured covariates of the treated unit to those of the control units. However, it has been established that in the absence of a good fit, such regression estimator will generally perform poorly. In this paper, we introduce a proximal causal inference framework to formalize identification and inference for both the SC and ultimately the treatment effect on the treated, based on the observation that control units not contributing to the construction of an SC can be repurposed as proxies of latent confounders. We view the difference in the post-treatment outcomes between the treated unit and the SC as a time series, which opens the door to various time series methods for treatment effect estimation. The proposed framework can accommodate nonlinear models, which allows for binary and count outcomes that are understudied in the SC literature. We illustrate with simulation studies and an application to evaluation of the 1990 German Reunification.

研究动机与目标

  • 解决当处理单元与捐赠单元之间前期拟合效果较差时,合成控制方法的局限性。
  • 通过将控制单元用作潜在混杂因素的代理变量,形式化合成控制权重的识别与推断。
  • 将合成控制方法扩展至非线性模型,包括二值结果和计数结果,这些在现有文献中尚未得到充分探索。
  • 在误差项存在序列相关性和潜在非平稳因子的情况下,实现稳健推断,克服传统基于OLS的SC估计的局限性。
  • 将处理单元与SC之间的后期结果差异视为时间序列,从而解锁时间序列分析工具用于处理效应估计。

提出的方法

  • 将未用于SC构建的控制单元重新用作潜在混杂因素的代理变量,利用其结果和同期协变量。
  • 基于近端矩条件,采用广义方法矩(GMM)方法,形式化合成控制权重的识别。
  • 将处理单元与SC之间后期结果的差异建模为具有确定性趋势的时间序列,以捕捉处理效应。
  • 对结果差异序列应用时间序列方法(如自回归模型或谱分析)以估计和推断处理效应。
  • 采用两种推断策略:当后期时间点较多时使用GMM(通过参数模型 τ(t/T;γ) 进行平滑),当时间点较小时使用因果推断。
  • 将框架扩展至非参数识别,放宽线性因子模型假设,从而实现对二值和计数结果的估计。

实验结果

研究问题

  • RQ1当前期拟合效果较差但潜在因子载荷匹配时,合成控制权重能否实现一致估计?
  • RQ2在存在未观测混杂因素的情况下,如何重新利用未对SC有贡献的控制单元来识别处理效应?
  • RQ3时间序列建模在从处理单元与SC之间的结果差异中估计和推断处理效应方面起什么作用?
  • RQ4所提出的框架能否处理合成控制情境下的非线性结果(如二值或计数数据)?
  • RQ5在误差项存在序列相关性和潜在非平稳因子的情况下,该方法表现如何?

主要发现

  • 近端因果推断框架即使在前期拟合效果较差的情况下,也能实现合成控制权重和处理效应的一致估计,原因在于利用辅助控制单元作为潜在混杂因素的代理变量。
  • 该方法支持SC权重的非参数识别,放宽了对线性因子模型的需求,使方法可应用于二值和计数结果。
  • 在德国统一的应用中,使用PI方法估计的处理效应为1,055美元(95%置信区间:488, 1,622),虚假检验未发现偏差(安慰剂效应:125美元,95%置信区间:-289, 539)。
  • 使用1975年作为安慰剂统一时间的虚假研究显示,无显著安慰剂效应,支持所提方法的有效性。
  • 该框架可通过GMM和因果推断实现推断,后者在后期时间点较少时尤为适用。
  • 该方法对误差项的序列相关性和潜在非平稳因子具有鲁棒性,将合成控制方法的适用范围扩展至传统假设之外。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。