[论文解读] Estimating Counterfactual Matrix Means with Short Panel Data
本文提出了一种新颖的方法,用于在存在缺失结果的短面板数据中估计反事实矩阵均值,利用低秩因子模型处理一般的缺失模式。该方法在结果维度固定的情况下实现一致且渐近正态的估计,并通过单次聚合因子估计的特征分解实现计算高效的推断,在半真实模拟中优于TWFE基线方法。
We develop a spectral approach for identifying and estimating average counterfactual outcomes under a low-rank factor model with short panel data and general outcome missingness patterns. Applications include event studies and studies of outcomes of "matches" between agents of two types, e.g. people and places, typically conducted using less-flexible Two-Way Fixed Effects (TWFE) models of outcomes. Given finite observed outcomes per unit, we show our approach identifies all counterfactual outcome means, including those not identified by existing methods, if a particular graph algorithm determines that units' sets of observed outcomes have sufficient overlap. Our analogous, computationally efficient estimation procedure yields consistent, asymptotically normal estimates of counterfactual outcome means under fixed-$T$ (number of outcomes), large-$N$ (sample size) asymptotics. When estimating province-level averages of held-out wages from an Italian matched employer-employee dataset, our estimator outperforms a TWFE-model-based estimator.
研究动机与目标
- 解决在大规模截面数据中每个单位仅观测到少数结果时估计反事实结果的挑战。
- 开发一种方法,以处理现有基于因子模型的方法无法支持的一般结果缺失模式。
- 在未观测混杂因素为低维的情况下,实现反事实均值的一致且渐近正态的估计。
- 通过仅需对聚合因子估计进行一次特征分解,确保计算效率。
- 弥合因子模型在短面板设置下灵活性与TWFE估计器稳健性之间的差距。
提出的方法
- 使用低秩因子模型表示结果,允许多维未观测混杂因素以不同方式影响不同结果。
- 通过具有相同观测结果模式的单位的子集聚合来估计因子载荷和共同冲击。
- 对由估计因子分量构建的类似协方差矩阵应用特征分解,以提取反事实均值得分。
- 利用聚合因子估计矩阵的特征空间,实施投影基估计器以获得反事实均值矩阵。
- 在正则性条件下(包括有界算子范数和严格前定性)推导渐近正态性和推断有效性。
- 采用两步估计程序:首先按结果模式组估计因子结构,然后聚合并分解以恢复反事实均值。
实验结果
研究问题
- RQ1当在大规模截面中每个单位仅观测到少数结果时,是否可以一致地估计反事实矩阵均值?
- RQ2在短面板数据中,如何处理超越TWFE或现有因子模型支持范围的一般结果缺失模式?
- RQ3依赖于对聚合因子估计进行单次特征分解的方法,在计算和统计效率方面表现如何?
- RQ4在存在复杂缺失和混杂的设定下,所提出的方法是否优于基于TWFE的估计器?
- RQ5在何种条件下,该估计器是渐近正态且适用于推断?
主要发现
- 在结果维度固定且存在一般缺失模式的条件下,所提方法可实现反事实结果均值的一致且渐近正态的估计。
- 通过仅需对基于子集的因子估计构建的矩阵进行一次特征分解,该估计器实现了计算效率。
- 在使用匹配雇主-员工数据的半真实模拟中,该方法在偏差和均方误差方面优于基于TWFE的估计器。
- 理论结果表明,该估计器的渐近分布在较弱的正则性条件下(包括有界算子范数和严格前定性)是有效的。
- 当缺失机制非忽略时,只要混杂因素为低维且由因子模型捕捉,该方法仍保持有效性。
- 该估计器的收敛速度为 $O_p(N^{-1/2})$,渐近分布通过特征子空间估计的摄动理论方法推导得出。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。