[论文解读] Inference for high-dimensional instrumental variables regression
本文提出了一种高维工具变量(IV)回归的新型一步去偏方法,即使在存在内生性的情况下,也能对单个回归系数实现渐近有效的推断。通过将参数化的一步更新方法适配至两阶段Lasso过程,并控制四项余项,该方法实现了渐近正态性,并为回归变量和工具变量均超过样本量的高维IV模型构建了有效的置信区间。
This paper concerns statistical inference for the components of a high-dimensional regression parameter despite possible endogeneity of each regressor. Given a first-stage linear model for the endogenous regressors and a second-stage linear model for the dependent variable, we develop a novel adaptation of the parametric one-step update to a generic second-stage estimator. We provide conditions under which the scaled update is asymptotically normal. We then introduce a two-stage Lasso procedure and show that the second-stage Lasso estimator satisfies the aforementioned conditions. Using these results, we construct asymptotically valid confidence intervals for the components of the second-stage regression coefficients. We complement our asymptotic theory with simulation studies, which demonstrate the performance of our method in finite samples.
研究动机与目标
- 在存在内生回归变量的情况下,实现对高维回归系数向量中单个分量的统计推断。
- 将去偏技术从低维和普通回归设置扩展至高维两阶段IV模型。
- 为双重高维情形(即回归变量和工具变量的数量均超过样本量)下的推断建立通用框架。
- 确定去偏估计量对单个系数产生渐近正态枢统计量的条件。
- 证明在这些条件下,利用两阶段Lasso估计量进行推断的可行性。
提出的方法
- 将参数化的一步更新方法适配至通用的两阶段估计量,利用有效矩条件的样本近似来校正内生性影响。
- 将更新后的估计量分解为主项与四项余项,以反映由内生性和高维性引入的复杂性。
- 采用改进的CLIME估计量来估计给定工具变量下内生回归变量条件均值的精度矩阵,同时考虑第一阶段预测误差的影响。
- 对依赖于E[X|Z]预测值的第二阶段Lasso估计量应用一步更新,确保在高维设置下的一致性。
- 推导第二阶段Lasso估计量ℓ1估计误差的概率界,以证明余项的渐近可忽略性。
- 基于噪声和工具变量的次高斯假设,支持灵活的分布建模并推导浓度不等式。
实验结果
研究问题
- RQ1在具有内生回归变量的高维IV模型中,能否为单个系数构建渐近有效的置信区间?
- RQ2在何种条件下,去偏的两阶段Lasso估计量能对单个回归系数实现渐近正态性?
- RQ3在回归变量和工具变量均超过样本量的高维设置下,去偏估计量中的估计误差和余项行为如何?
- RQ4工具变量之间的相关性以及活跃集大小对置信区间覆盖概率有何影响?
- RQ5所提出的方法能否扩展至Lasso以外的其他正则化估计量或广义矩方法框架?
主要发现
- 在多种配置下,该方法的置信区间覆盖率达到接近名义上的95%,且随着样本量增加,覆盖率稳定在约0.95。
- 随着活跃集大小(sβ)增加,覆盖率下降,这与已知的Lasso估计误差界一致,但样本量越大,覆盖率显著改善。
- 工具变量的托普利茨协方差结构导致的覆盖率低于循环对称结构,原因是工具变量间相关性更高。
- 置信区间的平均长度随样本量增加而减小,反映出去偏估计量精度的提升。
- 第二阶段Lasso估计量的均方误差(MSE)随样本量增大而减小,当n=500且px=600时,MSE降至0.001以下。
- 即使回归变量和工具变量的数量均超过样本量,该方法仍能实现渐近有效的推断,展现出在双重高维设置下的稳健性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。