[论文解读] Proxy Controls and Panel Data
本文提出了使用代理控制变量(proxy controls)进行因果效应的非参数识别、估计与推断方法——即观测变量作为未观测混杂因素的噪声但信息丰富的替代品。在具有固定时间期数的面板数据设定下,该文通过时间序列依赖结构实现识别,提出一种具有良好性质的估计量并构建了均匀置信带,进而将该方法应用于估计恩格尔曲线与留级的因果效应。
We provide new results for nonparametric identification, estimation, and inference of causal effects using `proxy controls': observables that are noisy but informative proxies for unobserved confounding factors. Our analysis applies to cross-sectional settings but is particularly well-suited to panel models. Our identification results motivate a simple and `well-posed' nonparametric estimator. We derive convergence rates for the estimator and construct uniform confidence bands with asymptotically correct size. In panel settings, our methods provide a novel approach to the difficult problem of identification with non-separable, general heterogeneity and fixed $T$. In panels, observations from different periods serve as proxies for unobserved heterogeneity and our key identifying assumptions follow from restrictions on the serial dependence structure. We apply our methods to two empirical settings. We estimate consumer demand counterfactuals using panel data and we estimate causal effects of grade retention on cognitive performance.
研究动机与目标
- 解决关键混杂因素未观测但存在代理控制变量时,因果推断中未观测混杂因素的挑战。
- 将条件平均潜在结果的非参数识别方法扩展至存在测量误差或代理控制变量的设定。
- 在弱正则性条件下,开发一种具有良好性质的非参数估计量,并构建渐近有效的均匀置信带。
- 针对具有不可分离异质性与固定T的面板数据模型,提出基于历史结果与处理变量作为代理控制变量的识别与估计策略。
- 通过两个实证应用展示该方法的实际效用:基于PSID数据的结构恩格尔曲线估计,以及基于ECLS-K数据的留级对认知表现因果影响的评估。
提出的方法
- 利用两个条件矩约束,在代理控制假设下识别条件平均潜在结果。
- 提出一种基于级数的非参数估计量,利用基展开以灵活建模连续处理变量与协变量。
- 在基本正则性条件下(包括有界矩与特征值衰减)建立一致性和收敛速率。
- 通过乘子自助法(multiplier bootstrap)推导估计量的渐近正态近似,以构建均匀置信带。
- 对潜在混杂因素与可观测变量施加时间序列依赖性限制,以证明在面板数据中可将过去时期的数据用作代理控制变量。
- 基于乘子自助法提出一个设定检验,以验证均匀推断程序的有效性。
实验结果
研究问题
- RQ1当未观测混杂因素仅能通过代理控制变量间接观测时,能否实现条件平均潜在结果的非参数识别?
- RQ2在不可分离异质性与未观测混杂因素存在的情况下,如何利用具有固定时间期数的面板数据识别因果效应?
- RQ3在何种正则性条件下,基于代理控制变量的非参数估计量具有良好性质并支持均匀推断?
- RQ4在面板模型中,过去结果与处理变量在多大程度上可作为持久未观测混杂因素的有效代理控制变量?
- RQ5在具有复杂非线性处理效应的真实世界应用中,所提出的方法表现如何?
主要发现
- 本文在两个对偶矩约束下,基于代理控制变量建立了条件平均潜在结果的非参数识别。
- 所提出的估计量具有良好性质,其收敛速率在标准非参数正则性条件下(包括有界矩与特征值衰减)得以推导。
- 通过乘子自助法程序构建了渐近正确尺寸的均匀置信带,实现了对连续协变量与处理变量的可靠推断。
- 在固定T的面板模型中,若未观测混杂因素满足时间序列依赖性限制,则历史观测可作为有效的代理控制变量。
- 该方法支持连续处理变量与协变量,无需参数假设即可灵活估计非线性处理效应。
- 实证应用表明,该方法能产生合理的反事实估计:基于PSID数据得到结构恩格尔曲线,基于ECLS-K数据识别出留级对认知表现的因果影响。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。