Skip to main content
QUICK REVIEW

[논문 리뷰] High Dimensional M-Estimation with Missing Outcomes: A Semi-Parametric Framework

Abhishek Chakrabortty, Jiarui Lu|arXiv (Cornell University)|2019. 11. 26.
Statistical Methods and Inference참고 문헌 59인용 수 8
한 줄 요약

이 논문은 결과 값이 누락된 상황과 고차원적 예측 변수를 고려한 반모수적 고차원 M-추정 프레임워크를 제안하며, L1-정규화된 비편향 이중로버스트(DDR) 추정량을 도입한다. 두 모수인 성향점수 모형과 결과 회귀 모형이 모두 올바를 경우, 최적의 $L_2$ 오차율 $ olimits\sqrt{s(\log d)/n}$ 을 달성하며, 오직 하나의 모형만 올바를 경우에도 일관성과 이중로버스트성을 유지하여 모형 잘못 설정하더라도 타당한 추론이 가능하다.

ABSTRACT

We consider high dimensional $M$-estimation in settings where the response $Y$ is possibly missing at random and the covariates $\mathbf{X} \in \mathbb{R}^p$ can be high dimensional compared to the sample size $n$. The parameter of interest $\boldsymbolθ_0 \in \mathbb{R}^d$ is defined as the minimizer of the risk of a convex loss, under a fully non-parametric model, and $\boldsymbolθ_0$ itself is high dimensional which is a key distinction from existing works. Standard high dimensional regression and series estimation with possibly misspecified models and missing $Y$ are included as special cases, as well as their counterparts in causal inference using 'potential outcomes'. Assuming $\boldsymbolθ_0$ is $s$-sparse ($s \ll n$), we propose an $L_1$-regularized debiased and doubly robust (DDR) estimator of $\boldsymbolθ_0$ based on a high dimensional adaptation of the traditional double robust (DR) estimator's construction. Under mild tail assumptions and arbitrarily chosen (working) models for the propensity score (PS) and the outcome regression (OR) estimators, satisfying only some high-level conditions, we establish finite sample performance bounds for the DDR estimator showing its (optimal) $L_2$ error rate to be $\sqrt{s (\log d)/ n}$ when both models are correct, and its consistency and DR properties when only one of them is correct. Further, when both the models are correct, we propose a desparsified version of our DDR estimator that satisfies an asymptotic linear expansion and facilitates inference on low dimensional components of $\boldsymbolθ_0$. Finally, we discuss various of choices of high dimensional parametric/semi-parametric working models for the PS and OR estimators. All results are validated via detailed simulations.

연구 동기 및 목표

  • 결과 값이 누락된 상황에서 고차원적 매개변수를 다루는 고차원 M-추정 문제를 해결하기 위해.
  • 성향점수 또는 결과 회귀 모형 중 하나만 올바르게 지정된 경우에도 일관성을 유지하는 이중로버스트이자 비편향적이며 정규화된 추정량을 개발하기 위해.
  • 성향점수 및 결과 회귀 모형에 대한 약한 尾尾 및 고차원 모델링 조건 하에서 제안된 추정량의 유한 표본 성능 경계를 수립하기 위해.
  • DDR 추정량의 비희박화된 형태를 통해 고차원 매개변수 $\bm{\theta}_0$ 의 저차원 성분에 대한 타당한 추론을 가능하게 하기 위해.
  • 비모수적 또는 반모수적 작업 모형을 고차원 예측 변수에 대해 선택할 수 있는 탄력적인 프레임워크를 제공하기 위해.

제안 방법

  • 희박성 조건이 있는 고차원 설정에 적합한 고전적 이중로버스트 추정량을 변형하여 L1-정규화된 비편향 이중로버스트(DDR) 추정량을 제안한다.
  • 성향점수 또는 결과 회귀 모형 중 하나만 올바를 경우에도 이중로버스트성을 확보하는 고차원적 이중로버스트 구성 방식을 사용한다.
  • 성향점수 및 결과 회귀 모형에 대한 작업 모형에 대해 약한 尾尾 조건과 고차원 조건 하에서 유한 표본 $L_2$ 오차 경계를 수립한다.
  • 고차원 매개변수 $\bm{\theta}_0$ 의 저차원 성분에 대한 점근 정규성과 추론이 가능하도록, DDR 추정량의 비희박화된 형태를 도입한다.
  • 매개변수 $\bm{\theta}_0$ 가 $s \ll n$ 개의 비영성분을 가지며 희박한 성질을 지닌 점을 고려해 고차원 급수 추정 및 정규화 기법을 활용한다.
  • 기본 위험 함수에 대한 비모수적 모델링이 가능하면서도 유한 표본 성능 보장을 유지하는 반모수적 프레임워크를 활용한다.

실험 결과

연구 질문

  • RQ1결과 값이 누락되고 고차원 예측 변수가 존재하는 상황에서 최적의 $L_2$ 오차율을 유지하는 고차원 M-추정량을 구성할 수 있는가?
  • RQ2성향점수 또는 결과 회귀 모형 중 하나만 올바르게 지정된 경우에도 제안된 추정량이 이중로버스트성을 유지하는가?
  • RQ3모형 잘못 설정 및 데이터 누락 조건 하에서 고차원 매개변수 $\bm{\theta}_0$ 의 저차원 성분에 대해 타당한 추론을 수행할 수 있는가?
  • RQ4약한 尾尾 조건 및 모델링 조건 하에서 제안된 DDR 추정량의 유한 표본 성능 경계는 무엇인가?
  • RQ5비모수적 또는 반모수적 모형을 비롯한 다양한 고차원 작업 모형이 비모수적 함수에 영향을 미치는 방식은 무엇인가?

주요 결과

  • 성향점수 및 결과 회귀 모형이 모두 올바르게 지정된 경우, 제안된 DDR 추정량은 최적의 $L_2$ 오차율 $ olimits\sqrt{s(\log d)/n}$ 을 달성한다.
  • 성향점수 또는 결과 회귀 모형 중 하나만 올바를 경우에도 추정량은 일관성과 이중로버스트성을 유지하여 모형 잘못 설정 조건 하에서도 타당한 추론이 가능하다.
  • DDR 추정량의 비희박화된 형태는 점근적 선형 전개를 만족하여 점근 정규성과 $\bm{\theta}_0$ 의 저차원 성분에 대한 타당한 추론을 가능하게 한다.
  • 약한 尾尾 조건과 작업 모형에 대한 고차원 조건 하에서 성능 경계가 확립되어 모형 잘못 설정에 대한 강건성을 확보한다.
  • 세부적인 시뮬레이션 분석을 통해 프레임워크의 타당성을 검증하였으며, 다양한 고차원 및 누락 데이터 상황에서 추정량의 강건성과 효율성을 입증하였다.
  • 이 방법은 표준 고차원 회귀, 급수 추정, 잠재적 결과 기반 원인 분석 등에 적용 가능하며, 이전의 프레임워크를 고차원 매개변수로 확장한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.