[論文レビュー] Inference in Linear Regression Models with Many Covariates and Heteroskedasticity
本稿は、多くの共変数と条件付き異分散性を伴う線形回帰モデルに対して、新しい不均一分散ロバスト標準誤差推定量 HC_K を提案する。従来の推定量(例:HC0–HC4)とは異なり、共変数の数が標本サイズに対して消えない割合で増加する場合でも一貫性を保ち、標準誤差がもはや一貫しない高次元設定における有効な推論を保証する。
The linear regression model is widely used in empirical work in Economics, Statistics, and many other disciplines. Researchers often include many covariates in their linear model specification in an attempt to control for confounders. We give inference methods that allow for many covariates and heteroskedasticity. Our results are obtained using high-dimensional approximations, where the number of included covariates are allowed to grow as fast as the sample size. We find that all of the usual versions of Eicker-White heteroskedasticity consistent standard error estimators for linear models are inconsistent under this asymptotics. We then propose a new heteroskedasticity consistent standard error formula that is fully automatic and robust to both (conditional)\ heteroskedasticity of unknown form and the inclusion of possibly many covariates. We apply our findings to three settings: parametric linear models with many covariates, linear panel models with many fixed effects, and semiparametric semi-linear models with many technical regressors. Simulation evidence consistent with our theoretical results is also provided. The proposed methods are also illustrated with an empirical application.
研究の動機と目的
- 多くの共変数を伴う線形回帰モデルにおける標準的な不均一分散ロバスト標準誤差の不一致を解決すること。
- 条件付き不均一分散および高次元の余分な回帰子が存在する状況でも有効な、完全に自動化された推論手法を開発すること。
- 共変数の数が標本サイズに対して比例して増加する場合のOLS推定量の分布近似を提供すること。
- 既存のHC推定量(HC0–HC4)の高次元漸近的性質を評価すること。
- 多くの固定効果を含む実応用において、不一致な標準誤差を使用した場合の実務的影響を示すこと。
提案手法
- 共変数の数 Kn が標本サイズ n に対して比例的に増加する高次元漸近的枠組みから導かれる、新しい不均一分散ロバスト分散推定量 HC_K を提案する。
- Kn/n → c ∈ (0,1) を満たす高次元近似下で、目的パラメータ β のOLS推定量の漸近正規性を確立する。
- Kn が n に対して大きくても成立する、OLS推定量の有効なガウス近似の高レベルな十分条件を導出する。
- 弱依存性およびモーメント条件の下で、高次元中心極限定理を用いてOLS推定量の漸近的分布を正当化する。
- パラメトリックモデルにおける多くの制御変数、多方向固定効果を伴う線形パネルモデル、多くの技術的回帰子を伴う半パラメトリックモデルの3つの設定に提案手法を適用する。
- シミュレーション研究およびNLSY79データセットへの実応用を通じて、理論的結果の妥当性を検証し、実務的影響を示す。
実験結果
リサーチクエスチョン
- RQ1共変数の数 Kn が標本サイズ n に対して消えない割合で増加する場合、従来の不均一分散ロバスト標準誤差(HC0–HC4)は一貫性を保つか?
- RQ2回帰子に特別な構造を仮定せずに、不均一分散および高次元共変数の両方にロバストな新しい標準誤差推定量を構築できるか?
- RQ3多くの固定効果を含む実応用において、不一致な標準誤差を使用した場合、統計的推論にどのような影響を与えるか?
- RQ4有限標本において、提案手法 HC_K は既存手法と比較してサイズと検出力の点でどのように異なるか?
- RQ5提案手法は、超高次元設定におけるモデル選択後の推論に適用可能か?
主な発見
- すべての従来の不均一分散ロバスト標準誤差推定量(HC0–HC4)は、共変数の数 Kn が標本サイズ n に対して消えない割合で増加する場合には不一致である。
- 提案された HC_K 推定量は、条件付き不均一分散および高次元共変数の両方の下で一貫性を示し、Kn/n ≈ 0.3 であっても成立する。
- NLSY79 への実応用において、高校卒業者における能力へのリターンは HC0 では有意であるが、HC_K や HC3 では有意でない。これは、従来手法が不一致のため過剰に棄却していることを示している。
- 大学教育を受けた個人の場合は、HC_K を含むすべての手法が有意な結果をもたらし、信号対雑音比が強い状況では一貫性が保たれている。
- シミュレーションの結果、HC_K は高次元設定でも正しいサイズと被覆率を維持しているのに対し、HC0–HC4 は深刻なサイズ歪みを示している。
- これらの結果は、モデル選択後に多くの共変数が残る状況では、従来の標準誤差に基づくモデル選択後の推論が無効であることを示唆しており、HC_K のような新たなロバスト手法の必要性を示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。