[论文解读] Inference in Linear Regression Models with Many Covariates and Heteroskedasticity
本文提出了一种新的异方差稳健标准误估计量 HC_K,适用于具有大量协变量和条件异方差性的线性回归模型。与传统估计量(如 HC0–HC4)不同,当协变量数量作为样本量的非消失分数时,HC_K 仍保持一致性,从而在标准误原本不一致的高维设定下确保有效的推断。
The linear regression model is widely used in empirical work in Economics, Statistics, and many other disciplines. Researchers often include many covariates in their linear model specification in an attempt to control for confounders. We give inference methods that allow for many covariates and heteroskedasticity. Our results are obtained using high-dimensional approximations, where the number of included covariates are allowed to grow as fast as the sample size. We find that all of the usual versions of Eicker-White heteroskedasticity consistent standard error estimators for linear models are inconsistent under this asymptotics. We then propose a new heteroskedasticity consistent standard error formula that is fully automatic and robust to both (conditional)\ heteroskedasticity of unknown form and the inclusion of possibly many covariates. We apply our findings to three settings: parametric linear models with many covariates, linear panel models with many fixed effects, and semiparametric semi-linear models with many technical regressors. Simulation evidence consistent with our theoretical results is also provided. The proposed methods are also illustrated with an empirical application.
研究动机与目标
- 解决在协变量数量较多的线性回归模型中,标准异方差稳健标准误的不一致性问题。
- 开发一种完全自动化的推断方法,该方法在存在条件异方差性和高维干扰回归量时仍保持有效。
- 在协变量数量与样本量成比例增长的情况下,为 OLS 估计量提供分布近似。
- 评估现有 HC 估计量(HC0–HC4)在高维渐近设定下的表现。
- 展示在具有大量固定效应的实证应用中使用不一致标准误的实际影响。
提出的方法
- 提出一种新的异方差稳健方差估计量 HC_K,其基于协变量数量 Kn 随样本量 n 成比例增长的高维渐近框架。
- 在高维近似下建立对感兴趣参数 β 的 OLS 估计量的渐近正态性,允许 Kn/n → c ∈ (0,1)。
- 推导出 OLS 估计量有效高斯近似的高层充分条件,即使 Kn 相对于 n 较大时也成立。
- 利用高维中心极限定理,证明在弱依赖和矩条件下的 OLS 估计量渐近分布。
- 将所提方法应用于三种设定:具有大量控制变量的参数模型、具有多向固定效应的线性面板模型,以及具有大量技术回归量的半参数模型。
- 通过模拟研究和对 NLSY79 数据集的实证应用,验证理论结果并说明实际影响。
实验结果
研究问题
- RQ1当协变量数量 Kn 作为样本量 n 的非消失分数时,传统异方差稳健标准误(HC0–HC4)是否仍保持一致性?
- RQ2能否构造一种新的标准误估计量,对异方差性和高维协变量均具有稳健性,且无需对回归量施加特殊结构假设?
- RQ3在具有大量固定效应的实证应用中,使用不一致标准误对统计推断有何影响?
- RQ4在有限样本中,所提出的 HC_K 估计量与现有方法在大小和功效方面相比如何?
- RQ5所提方法能否应用于超高维设定下的模型选择后推断?
主要发现
- 当协变量数量 Kn 作为样本量 n 的非消失分数增长时,所有传统异方差稳健标准误估计量(HC0–HC4)均不一致。
- 所提出的 HC_K 估计量在条件异方差性和高维协变量下均保持一致,即使 Kn/n ≈ 0.3 时亦然。
- 在 NLSY79 的实证应用中,高中毕业生的能力回报在 HC0 下具有统计显著性,但在 HC_K 或 HC3 下不显著,表明传统方法因不一致而过度拒绝。
- 对于受过大学教育的个体,所有方法(包括 HC_K)均得出显著结果,表明在信号噪声比更强的设定下具有稳健性。
- 模拟证据表明,HC_K 在高维设定下保持正确的大小和覆盖概率,而 HC0–HC4 显示出严重的大小扭曲。
- 结果表明,当模型选择后仍保留大量协变量时,基于传统标准误的模型选择后推断无效,因此需要像 HC_K 这类新的稳健方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。