Skip to main content
QUICK REVIEW

[论文解读] Causal Inference in Possibly Nonlinear Factor Models

Yingjie Feng|arXiv (Cornell University)|Aug 31, 2020
Advanced Causal Inference Techniques参考文献 40被引用 9
一句话总结

本文提出了一种因果推断方法,用于处理存在未观测混杂因素的处理效应模型,通过利用一组与潜在混杂因素通过未知且可能非线性的因子结构相关联的大量噪声高维测量数据。该方法结合K近邻匹配与主成分分析,采用局部主子空间近似来估计潜在混杂因素,从而在较弱的正则性条件下实现平均处理效应和反事实分布的双重稳健估计。

ABSTRACT

This paper develops a general causal inference method for treatment effects models with noisily measured confounders. The key feature is that a large set of noisy measurements are linked with the underlying latent confounders through an unknown, possibly nonlinear factor structure. The main building block is a local principal subspace approximation procedure that combines $K$-nearest neighbors matching and principal component analysis. Estimators of many causal parameters, including average treatment effects and counterfactual distributions, are constructed based on doubly-robust score functions. Large-sample properties of these estimators are established, which only require relatively mild conditions on the principal subspace approximation. The results are illustrated with an empirical application studying the effect of political connections on stock returns of financial firms, and a Monte Carlo experiment. The main technical and methodological results regarding the general local principal subspace approximation method may be of independent interest.

研究动机与目标

  • 解决混杂因素未被观测但通过大量噪声高维协变量间接测量的设定下的因果推断问题。
  • 开发一种方法,无需对潜在混杂因素与观测测量之间的关系做参数假设,从而允许灵活的、可能非线性的因子结构。
  • 在高维、噪声混杂因素代理变量存在的情况下,实现对平均处理效应和反事实分布的估计。
  • 在局部主子空间近似满足较弱正则性条件的前提下,建立估计量的大样本性质。
  • 提供一种预处理工具——局部主成分分析,可与现有计量经济学方法集成,用于异质处理效应分析。

提出的方法

  • 该方法首先在观测协变量上进行K近邻(K-NN)匹配,以形成局部邻域,其中K随样本量发散。
  • 在每个局部邻域内,对K个最近邻的协变量应用主成分分析(PCA),以估计局部因子结构并提取低维潜在混杂因素代理变量。
  • 利用局部PCA估计的因子载荷和主成分,构建用于因果参数(如平均处理效应和反事实分布)的双重稳健得分函数。
  • 该方法允许潜在混杂因素与观测测量之间存在灵活的非参数关系,避免强参数假设。
  • 通过使用局部准最大似然估计方法,将该方法扩展至广义部分线性模型,用于结果模型和处理模型。
  • 最终估计量以局部主成分分析的输出作为输入构建,从而可与标准计量经济学技术(如局部多项式回归)集成。

实验结果

研究问题

  • RQ1当混杂因素未被观测但通过高维噪声协变量集间接测量时,如何一致地估计处理效应?
  • RQ2我们能否开发一种因果推断方法,使其在潜在混杂因素与观测代理变量之间存在未知且可能非线性的因子结构时仍保持有效性?
  • RQ3在此设定下,基于局部主子空间近似的估计量具有怎样的大样本性质?
  • RQ4当混杂因素结构为非参数且高维时,如何实现估计的双重稳健性?
  • RQ5该方法在多大程度上可推广至部分线性模型及其他半参数框架?

主要发现

  • 所提出的局部主子空间近似方法在因子结构和邻域选择满足较弱正则性条件时,能一致估计潜在混杂因素。
  • 平均处理效应和反事实分布的估计量渐近正态且具有双重稳健性,依赖于结果模型和倾向得分模型。
  • 即使仅部分观测协变量对潜在混杂因素具有信息量,该方法仍保持有效,且无需事先知道哪些协变量具有信息量。
  • 估计的混杂因素代理变量的收敛速度足够快,可保持下游估计量的大样本性质。
  • 该方法对潜在混杂因素与观测代理变量之间函数形式的模型误设具有鲁棒性,因其不假设线性关系。
  • 实证应用表明,政治关联显著影响金融企业的股票回报,且结果对高维代理结构具有稳健性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。