[논문 리뷰] Cluster-Robust Standard Errors for Linear Regression Models with Many Controls
이 논문은 표본 크기와 비례하여 증가하는 많은 조절 변수를 포함한 선형 회귀 모형에 대해, 기존의 군집 로버스트 표준오차의 부일관성 문제를 수정하는 새로운 군집 로버스트 분산 추정량을 제안한다. 이 방법은 고차원 점점 증가하는 점근적 조건 하에서, 많은 조절 변수가 유도하는 편향을 보정함으로써 타당한 추론을 보장하며, 이론적 분석과 몽테카를로 시뮬레이션을 통해 유한 표본에서의 성능 향상이 입증된다.
It is common practice in empirical work to employ cluster-robust standard errors when using the linear regression model to estimate some structural/causal effect of interest. Researchers also often include a large set of regressors in their model specification in order to control for observed and unobserved confounders. In this paper we develop inference methods for linear regression models with many controls and clustering. We show that inference based on the usual cluster-robust standard errors by Liang and Zeger (1986) is invalid in general when the number of controls is a non-vanishing fraction of the sample size. We then propose a new clustered standard errors formula that is robust to the inclusion of many controls and allows to carry out valid inference in a variety of high-dimensional linear regression models, including fixed effects panel data models and the semiparametric partially linear model. Monte Carlo evidence supports our theoretical results and shows that our proposed variance estimator performs well in finite samples. The proposed method is also illustrated with an empirical application that re-visits Donohue III and Levitt's (2001) study of the impact of abortion on crime.
연구 동기 및 목표
- 표본 크기의 비례적으로 증가하는 조절 변수 수가 있는 경우, 기존의 군집 로버스트 표준오차 추정량이 부일관성이 발생하는 문제를 해결하기 위해.
- 특히 고차원 설정에서, 많은 조절 변수와 군집화가 함께 존재하는 선형 회귀 모형에 대해 강력한 추론 방법을 개발하기 위해.
- 고차원 점진적 조건 하에서 고정효과 패널 데이터 모형과 반반응형 부분선형 모형과 같은 모형으로의 타당한 추론을 확장하기 위해.
- 많은 조절 변수로 인해 발생하는 유한 표본 편향을 수정하기 위해.
- 모든 $ K_n/n \not\to 0 $ 조건 하에서도 일관성과 점점 증가하는 타당성을 유지하는 분산 추정량을 제공하기 위해.
제안 방법
- 고차원 선형 모형에서 많은 조절 변수가 유도하는 편향을 보정하기 위해, 새로운 군집 로버스트 분산 추정량을 제안한다.
- 처리 변수와 조절 변수를 모두 포함하는 행렬 $ X_n $ 에 기반한 사영 행렬 $ M_n = X_n(X_n'X_n)^{-1}X_n' $ 을 바탕으로 수정된 분산 추정량을 유도한다.
- 군집 내 의존성과 오차 공분산 행렬의 구조를 고려한 가중치 체계 $ \kappa_n $ 를 도입한다.
- 중간 항에 $ S_n' (M_n \otimes M_n) S_n $ 가 포함된 샌드위치 추정량의 역행렬 기반으로 일관된 추정량 $ \hat{\Sigma}_n(\kappa_n^{\texttt{CR}}) $ 을 사용한다.
- 군집 내 비영공분산 블록을 정의하기 위해 집합 $ \mathcal{V}_{g,n} $ 과 $ \mathcal{R}_{g,i,n} $ 을 사용한 오차 구조의 재매개변수화를 시행한다.
- 고차원 점진적 조건 하에서 고정효과 모형과 반반응형 부분선형 모형을 포함한 많은 조절 변수가 존재하는 모형에 추정량을 적용한다.
실험 결과
연구 질문
- RQ1표본 크기의 비례적으로 증가하는 조절 변수 수가 있는 경우, Liang와 Zeger(1986)가 제안한 전통적인 군집 로버스트 표준오차 추정량은 일관성이 있는가?
- RQ2고차원 점진적 조건 하에서 $ K_n/n \not\to 0 $ 인 경우에도 일관성과 타당성을 유지하는 새로운 군집 로버스트 분산 추정량을 구성할 수 있는가?
- RQ3유한 표본에서 제안된 추정량은 기존의 군집 로버스트 표준오차 대비 어떻게 성능을 보이는가?
- RQ4새로운 추정량은 많은 조절 변수가 존재하는 고정효과 모형과 반반응형 구성요소를 포함하는 모형에 적용 가능한가?
- RQ5제안된 추정량이 점근 정규성과 일관성을 확보하기 위한 충분한 조건는 무엇인가?
주요 결과
- 표본 크기의 비례적으로 증가하는 조절 변수 수가 있는 경우, 기존의 군집 로버스트 표준오차 추정량은 $ K_n/n \not\to 0 $ 일 때 일관성이 없으며, 이는 고차원 설정에서 추론을 무효화한다.
- 제안된 추정량 $ \hat{\Sigma}_n(\kappa_n^{\texttt{CR}}) $ 는 고차원 점진적 조건 하에서도 일관성과 점점 증가하는 타당성을 유지하며, $ K_n $ 이 $ n $ 과 비슷한 속도로 증가할 때도 성립한다.
- 몽테카를로 결과는 새로운 추정량이 유한 표본에서 잘 작동하며, 크기 왜곡을 감소시키고 신뢰구간의 커버리지 성능을 향상시킨다.
- 고정효과 패널 모형과 많은 조절 변수가 존재하는 반반응형 부분선형 모형에서도 추정량은 타당하게 유지된다.
- 이론적 분석은 $ \mathbb{E}[\tilde{\Sigma}_n(\mathbf{I}_{L_n})|\mathcal{X}_n,\mathcal{W}_n] = \Sigma_n + o_p(1) $ 를 확인하여 일관성을 보장한다.
- 비정규 근사에 의존하지 않고, 많은 조절 변수로 인한 표준오차의 편향을 보정한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.