[논문 리뷰] Two-sample testing in non-sparse high-dimensional linear models
이 논문은 고차원 선형 모델에서 회귀 계수의 희박성 가정 없이도 작동하는 새로운 이중표본 검정 프레임워크인 TIERS를 제안한다. 두 표본을 컨볼루션하여 기울기 동일성 가설을 모멘트 조건으로 변환하고, 자기정규화(self-normalization)를 사용함으로써, 약한 모멘트 및 尾尾 조건 하에서도 $ p \to \infty $, $ n \to \infty $, $ p/n \to \infty $ 인 경우에도 유의수준 오류 제어가 강인하게 유지된다. 또한 Auto-aDaptive Dantzig Selector(ADDS)와 고차원 플러그인 임계값 근사 방법을 도입한다.
In analyzing high-dimensional models, sparsity of the model parameter is a common but often undesirable assumption. In this paper, we study the following two-sample testing problem: given two samples generated by two high-dimensional linear models, we aim to test whether the regression coefficients of the two linear models are identical. We propose a framework named TIERS (short for TestIng Equality of Regression Slopes), which solves the two-sample testing problem without making any assumptions on the sparsity of the regression parameters. TIERS builds a new model by convolving the two samples in such a way that the original hypothesis translates into a new moment condition. A self-normalization construction is then developed to form a moment test. We provide rigorous theory for the developed framework. Under very weak conditions of the feature covariance, we show that the accuracy of the proposed test in controlling Type I errors is robust both to the lack of sparsity in the features and to the heavy tails in the error distribution, even when the sample size is much smaller than the feature dimension. Moreover, we discuss minimax optimality and efficiency properties of the proposed test. Simulation analysis demonstrates excellent finite-sample performance of our test. In deriving the test, we also develop tools that are of independent interest. The test is built upon a novel estimator, called Auto-aDaptive Dantzig Selector (ADDS), which not only automatically chooses an appropriate scale of the error term but also incorporates prior information. To effectively approximate the critical value of the test statistic, we develop a novel high-dimensional plug-in approach that complements the recent advances in Gaussian approximation theory.
연구 동기 및 목표
- 회귀 계수에 희박성 가정이 없을 때 고차원 이중표본 검정을 위한 체계적 추론 방법의 부족을 해결하기 위해.
- 특징 공분산과 오차 분포에 대한 약한 가정 하에서도, 무거운 尾尾 분포가 존재하더라도 정확한 유의수준 오류 제어를 유지할 수 있는 검정을 개발하기 위해.
- 진짜 회귀 매개변수의 희박성이 필요 없이 $ p \to \infty $, $ n \to \infty $, $ p/n \to \infty $ 상황에서도 강인한 방법을 구축하기 위해.
- 오차 분산 스케일을 적응적으로 선택하고 사전 지식을 통합하는 새로운 추정기인 Auto-aDaptive Dantzig Selector(ADDS)를 도입하기 위해.
- 최근의 가우시안 근사 이론을 보완하기 위해 고차원 설정에서 임계값을 추정하기 위한 플러그인 방법을 개발하기 위해.
제안 방법
- TIERS는 두 표본의 컨볼루션을 구성함으로써 원래의 이중표본 가설 $ H_0: \beta_A = \beta_B $ 를 새로운 모멘트 조건으로 변환한다.
- 변환된 자료에 자기정규화 절차를 적용하여 근사적으로 분포가 자유로운 기초통계량을 구성한다.
- Auto-aDaptive Dantzig Selector(ADDS)는 오차 분산 스케일을 적응적으로 선택하고 사전 지식을 통합하는 새로운 추정기로 도입된다.
- 기초통계량의 임계값은 고차원 플러그인 방법을 사용하여 근사한다. 이는 부트스트랩이나 재표본 추출을 피하고 유한표본 성능을 향상시킨다.
- 이론적 분석은 최대값의 분산을 제어하기 위해 반집중 불등식과 준가우시안 꼬리 경계를 활용한다.
- 의존적인 랜덤 벡터의 최대값 수렴에 관한 보조정리와 조건부 가우시안 조건 하에서의 반집중 불등식을 사용하여 검정의 강인성을 입증한다.
실험 결과
연구 질문
- RQ1회귀 계수의 희박성 가정 없이도 고차원 선형 모델에 대한 이중표본 검정 절차를 개발할 수 있는가?
- RQ2특징 수 $ p $ 가 표본 크기 $ n $ 보다 훨씬 클 때, 비희박 모델 조건 하에서도 정확한 유의수준 오류 제어를 확보할 수 있는가?
- RQ3무거운 꼬리 오차와 비희박 설계 행렬이 고차원 이중표본 검정의 타당성에 어떤 영향을 미치는가?
- RQ4재표본 추출 없이도 고차원 설정에서 플러그인 방법을 사용해 기초통계량의 임계값을 근사할 수 있는가?
- RQ5제안된 검정은 비희박 고차원 모델 하에서 최소최대 최적성 또는 효율성을 달성하는가?
주요 결과
- TIERS는 진짜 회귀 계수가 조밀할 경우에도 특징 공분산의 구조에 대해 매우 약한 조건 하에서 정확한 유의수준 오류 제어를 유지한다.
- 검정은 중앙값이 무거운 꼬리 분포에 대해서도 강인하며, 준가우시안 또는 경량 꼬리 가정이 필요 없다.
- Auto-aDaptive Dantzig Selector(ADDS)는 오차 분산 스케일을 자동으로 선택하고 사전 지식을 통합함으로써 추정의 안정성을 향상시킨다.
- 임계값 근사에 대한 고차원 플러그인 방법은 강한 유한표본 성능을 달성하고 계산 비용이 큰 재표본 추출을 피한다.
- 이론적 분석 결과, 검정은 비희박성 있는 회귀 매개변수와 비희박 설계 행렬에 대해서도 강인하며, $ p/n \to \infty $ 조건 하에서도 성립한다.
- 시뮬레이션 연구를 통해 적절한 정규성 조건 하에서 최소최대 최적성과 효율성을 달성함을 입증하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.