[論文レビュー] Cluster-Robust Standard Errors for Linear Regression Models with Many Controls
本稿は、サンプルサイズと比例して増加する数の制御変数を伴う線形回帰モデルにおける、クラスターロバスト分散推定量の新規提案を行う。標準的なクラスターロバスト標準誤差が不一致となる状況を是正し、高次元漸近的枠組み下で有効な推論を保証する。多くの制御変数が引き起こすバイアスを補正することで、理論的およびモンテカルロ実験の両面から、有限標本における性能向上が示された。
It is common practice in empirical work to employ cluster-robust standard errors when using the linear regression model to estimate some structural/causal effect of interest. Researchers also often include a large set of regressors in their model specification in order to control for observed and unobserved confounders. In this paper we develop inference methods for linear regression models with many controls and clustering. We show that inference based on the usual cluster-robust standard errors by Liang and Zeger (1986) is invalid in general when the number of controls is a non-vanishing fraction of the sample size. We then propose a new clustered standard errors formula that is robust to the inclusion of many controls and allows to carry out valid inference in a variety of high-dimensional linear regression models, including fixed effects panel data models and the semiparametric partially linear model. Monte Carlo evidence supports our theoretical results and shows that our proposed variance estimator performs well in finite samples. The proposed method is also illustrated with an empirical application that re-visits Donohue III and Levitt's (2001) study of the impact of abortion on crime.
研究の動機と目的
- サンプルサイズに対して非ゼロの割合として制御変数の数が増加する状況下で、従来のクラスターロバスト標準誤差が不一致となる問題を解決すること。
- 特に高次元設定下で、多くの制御変数とクラスタリングを伴う線形回帰モデルに対するロバストな推論手法を開発すること。
- 高次元漸近的枠組み下で、固定効果パネルデータモデルや半パラメトリック部分線形モデルなどにまで有効な推論を拡張すること。
- 多くの制御変数が原因で生じる小標本バイアスを是正すること。
- K_n/n \not\to 0 である場合でも、一貫性と漸近的有効性を保つ分散推定量を提供すること。
提案手法
- 高次元線形モデルにおける多くの制御変数が引き起こすバイアスを補正する新しいクラスターロバスト分散推定量を提案する。
- X_n に処理変数と制御変数が含まれる投影行列 M_n = X_n(X_n'X_n)^{-1}X_n' をもとに、修正された分散推定量を導出する。
- クラスタ内相関と誤差共分散行列の構造を反映する重み付けスキーム \kappa_n を導入する。
- S_n' (M_n \otimes M_n) S_n を含む、サンドイッチ推定量の中間項の逆行列に基づく一貫性推定量 \hat{\Sigma}_n(\kappa_n^{\texttt{CR}}) を使用する。
- クラスタ内での非ゼロ共分散ブロックを定義するために、集合 \mathcal{V}_{g,n} と \mathcal{R}_{g,i,n} を用いた誤差構造の再パrameter化を実施する。
- 高次元漸近的枠組み下で、固定効果モデルや半パラメトリック部分線形モデルを含む、多くの制御変数を伴うモデルにこの推定量を適用する。
実験結果
リサーチクエスチョン
- RQ1Liand Zeger (1986) が提唱した従来のクラスターロバスト標準誤差推定量は、制御変数の数がサンプルサイズに対して非ゼロの割合で増加する場合に一貫性を示すか?
- RQ2K_n/n \not\to 0 である高次元漸近的枠組み下でも一貫性と有効性を保つ新しいクラスターロバスト分散推定量を構築可能か?
- RQ3提案手法の有限標本における性能は、標準的なクラスターロバスト標準誤差と比較していかがであるか?
- RQ4新しい推定量は、多くの制御変数を伴う固定効果モデルや半パラメトリック成分を含むモデルに適用可能か?
- RQ5提案推定量が漸近正規性および一貫性を達成するための十分条件は何か?
主な発見
- K_n/n \not\to 0 の場合、従来のクラスターロバスト標準誤差推定量は不一致であり、高次元設定下での推論を無効にする。
- 提案推定量 \hat{\Sigma}_n(\kappa_n^{\texttt{CR}}) は、K_n が n と同程度に増加する高次元漸近的枠組み下でも一貫性と漸近的有効性を保つ。
- モンテカルロ実験の結果、提案推定量は有限標本でも良好な性能を示し、有意水準の歪みを低減し信頼区間のカバレッジを改善した。
- 固定効果パネルモデルや多くの制御変数を伴う半パラメトリック部分線形モデルにおいても、推定量は有効である。
- 理論的分析により、\mathbb{E}[\tilde{\Sigma}_n(\mathbf{I}_{L_n})|\mathcal{X}_n,\mathcal{W}_n] = \Sigma_n + o_p(1) が成立し、一貫性が保証された。
- 非ガウス近似に依存せず、多くの制御変数が原因で生じる標準誤差のバイアスを是正する。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。