Skip to main content
QUICK REVIEW

[论文解读] Double Machine Learning for Static Panel Models with Fixed Effects

Paul B. S. Clarke, Annalivia Polselli|arXiv (Cornell University)|Dec 13, 2023
Energy, Environment, Economic Growth被引用 6
一句话总结

本文提出了一种用于具有固定效应的静态面板数据模型的双重机器学习(DML)框架,通过样本分割和基于机器学习的干扰参数估计,对处理效应进行正交化,从而实现因果推断。该方法即使在高维或非线性混杂情况下,也能确保处理效应估计量的根n渐近正态性,相较于传统的OLS和Lasso,在偏差减少和稳健性方面表现更优,适用于多种模拟设计和实证应用。

ABSTRACT

Recent advances in causal inference have seen the development of methods which make use of the predictive power of machine learning algorithms. In this paper, we develop novel double machine learning (DML) procedures for panel data in which these algorithms are used to approximate high-dimensional and nonlinear nuisance functions of the covariates. Our new procedures are extensions of the well-known correlated random effects, within-group and first-difference estimators from linear to nonlinear panel models, specifically, Robinson (1988)'s partially linear regression model with fixed effects and unspecified nonlinear confounding. Our simulation study assesses the performance of these procedures using different machine learning algorithms. We use our procedures to re-estimate the impact of minimum wage on voting behaviour in the UK. From our results, we recommend the use of first-differencing because it imposes the fewest constraints on the distribution of the fixed effects, and an ensemble learning strategy to ensure optimum estimator accuracy.

研究动机与目标

  • 解决具有固定效应的静态面板数据模型中混杂问题,其中未观测到的个体异质性可能与处理变量内生相关。
  • 将双重机器学习(DML)扩展至面板数据场景,即使在高维或非线性干扰参数下,也能实现对处理效应的有效推断。
  • 基于Mundlak方法的固定效应装置,开发并评估新型估计量——CRE、WG/FD-混合型和WG/FD-近似型,利用机器学习灵活建模结果的条件均值。
  • 通过蒙特卡洛模拟和关于最低工资与投票行为的实证应用,展示DML在面板数据中的稳健性和有限样本表现。
  • 提供一种实用且可推广的框架,使DML可与任意机器学习方法(如Lasso、CART、随机森林)结合,应用于观察性面板数据场景。

提出的方法

  • 使用样本分割将数据划分为K个子集,在每个子集中分别估计干扰函数(如处理变量和结果变量的条件期望),以避免过拟合。
  • 在每个子集中应用机器学习方法——Lasso、CART、随机森林——来估计干扰函数 $\widehat{m}(\mathbf{x}_{it})$ 和 $\widehat{l}(\mathbf{x}_{it})$,并通过随机网格搜索进行超参数调优。
  • 采用两阶段DML程序:首先在每个子集中估计干扰参数;其次,利用残差化后的处理变量和结果变量求解正交化估计方程以获得 $\theta$。
  • 基于矩条件 $\mathbb{E}[\psi(\widetilde{W}_{it}; \theta, \widehat{\eta}_k)] = 0$ 推导出DML估计量 $\widehat{\theta}_k$ 的闭式解,其中 $\psi$ 定义为残差化处理变量与残差化结果变量的乘积。
  • 通过平均各子集的 $\widehat{\theta}_k$ 估计值,得到最终的DML估计量,该估计量在正则条件下保证根n一致性与渐近正态性。
  • 使用聚类稳健的方差估计进行推断,其中 $\widehat{J}_0$ 由各子集中处理回归的平均平方残差计算得出。
Double Machine Learning for Static Panel Models with Fixed Effects

实验结果

研究问题

  • RQ1双重机器学习能否成功适配具有固定效应的静态面板数据模型,以实现对处理效应的有效推断?
  • RQ2当真实函数形式为非线性或高维时,不同机器学习方法(如Lasso、CART、随机森林)在估计干扰参数方面的表现如何?
  • RQ3在具有固定效应的有限样本中,与传统的OLS和Lasso相比,结合样本分割与正交化的DML方法是否能更有效地降低偏差?
  • RQ4DML估计量对超参数调优的敏感性如何?这对实证稳健性有何影响?
  • RQ5DML框架能否在真实世界面板数据中有效应用,例如英国最低工资对投票行为的影响?

主要发现

  • 与OLS及使用词典的Lasso相比,使用Lasso、CART和随机森林的DML在估计处理效应时显著降低了偏差,尤其在非线性数据生成过程(DGPs)下表现更优。
  • 基于树的方法(CART和随机森林)表现出标准误的低估和抽样分布的非正态性,表明在小样本中可能存在大小尺度扭曲。
  • 由于正交化与样本分割机制,即使干扰函数为非线性,DML估计量仍能保持根n一致性与渐近正态性。
  • 在英国最低工资的实证应用中,使用CART和随机森林的DML得出更大的估计值(0.149,标准误=0.127),而OLS估计值为(0.088,标准误=0.045),表明线性模型可能存在异质性或模型误设。
  • 通过随机网格搜索进行超参数调优的DML框架,在包括非光滑和非线性关系在内的多种DGP下均表现出稳健性能。
  • WG/FD-混合型与CRE估计量在有限样本中表现优于标准固定效应估计量,尤其当固定效应与协变量呈非线性关系时。
(a)
(a)

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。