Skip to main content
QUICK REVIEW

[논문 리뷰] Practical targeted learning from large data sets by survey sampling

Patrice Bertail, Antoine Chambaz|arXiv (Cornell University)|2016. 06. 30.
Statistical Methods and Inference참고 문헌 21인용 수 3
한 줄 요약

이 논문은 계산 부담을 줄이기 위해 비균일 포함 확률을 가진 설문 조사 샘플링을 사용하여 대규모 데이터 세트에 대한 실용적인 타겟 학습 접근법을 제안한다. 요약 통계에 기반한 하위 표본을 선택하고 타겟 최소 손실 추정(TMLE)을 적용함으로써, 점점 정규 분포를 따르는 추정량과 타당한 신뢰구간을 달성하며, 포함 확률는 분산을 최소화하도록 최적화된다.

ABSTRACT

We address the practical construction of asymptotic confidence intervals for smooth (i.e., path-wise differentiable), real-valued statistical parameters by targeted learning from independent and identically distributed data in contexts where sample size is so large that it poses computational challenges. We observe some summary measure of all data and select a sub-sample from the complete data set by Poisson rejective sampling with unequal inclusion probabilities based on the summary measures. Targeted learning is carried out from the easier to handle sub-sample. We derive a central limit theorem for the targeted minimum loss estimator (TMLE) which enables the construction of the confidence intervals. The inclusion probabilities can be optimized to reduce the asymptotic variance of the TMLE. We illustrate the procedure with two examples where the parameters of interest are variable importance measures of an exposure (binary or continuous) on an outcome. We also conduct a simulation study and comment on its results. keywords: semiparametric inference; survey sampling; targeted minimum loss estimation (TMLE)

연구 동기 및 목표

  • 표본 크기 N이 매우 클 경우 타겟 학습에서 발생하는 계산 과제를 해결한다.
  • 대규모 데이터 환경에서 부드럽고 경로에 따라 미분 가능한 통계적 파rameter에 대해 渐近 신뢰구간을 구성할 수 있는 실용적인 방법을 개발한다.
  • 전체 데이터의 요약 통계에 기반한 설문 조사 샘플링 기법—특히 비균일 포함 확률을 가진 기각 샘플링—을 활용하여 효율적인 추론을 가능하게 한다.
  • 타겟 최소 손실 추정기(TMLE)의 점점 정규 분포를 따르는 분산을 최소화하기 위해 포함 확률를 최적화한다.
  • 변수 중요도 측정치에 대한 이론적 결과와 시뮬레이션 연구를 통해 방법의 타당성과 효율성을 입증한다.

제안 방법

  • 전체 데이터 세트의 요약 측정치를 기반으로 비균일 포함 확률를 가진 포isson 기각 샘플링을 사용하여 처리 가능한 크기의 하위 표본 n(N) << N을 선택한다.
  • 하위 표본에 대해 타겟 최소 손실 추정(TMLE)을 적용하여 관심 파rameter를 추정하며, 이중 강건성과 효율성을 보장한다.
  • 샘플링 설계 하에서 TMLE에 대한 중심극한정리(central limit theorem)를 유도하여 점점 정규 분포를 따르는 추정량의 구축을 가능하게 한다.
  • 영향 함수를 활용하여 포함 확률를 최적화하여 TMLE 추정기의 점점 정규 분포를 따르는 분산을 최소화한다.
  • Horvitz-Thompson 경험 측도와 경험 과정 이론을 활용하여 샘플링 체계 하에서 점점 정규 분포를 따르는 성질과 균일 수렴을 확립한다.
  • 기능 중심극한정리와 엔트로피 조건을 사용하여 모형 공간의 약한 정규성 가정 하에서 추정기의 점점 정규 분포를 검증한다.

실험 결과

연구 질문

  • RQ1전체 데이터 계산이 불가능한 매우 큰 데이터 세트에 대해 타겟 학습을 실용적으로 적용할 수 있는가?
  • RQ2비균일 포함 확률를 가진 설문 조사 샘플링이 대규모 환경에서 TMLE의 효율성을 어떻게 향상시킬 수 있는가?
  • RQ3비균일 확률를 가진 기각 샘플링 하에서 TMLE의 점점 정규 분포는 어떻게 되는가?
  • RQ4비균일 포함 확률를 최적화하여 대규모 데이터 환경에서 TMLE의 점점 정규 분포를 따르는 분산을 줄일 수 있는가?
  • RQ5제안된 방법은 매우 큰 데이터 세트에서 노출-결과 관계의 변수 중요도 측정치를 추정하는 데 어떻게 성능을 발휘하는가?

주요 결과

  • 제안된 방법은 전체 데이터 세트의 하위 표본만을 사용하여 부드러운 통계적 파rameter에 대해 타당한 점점 정규 분포를 따르는 신뢰구간을 제공한다.
  • 기각 샘플링 설계 하에서 TMLE에 대한 중심극한정리가 성립하여, N이 매우 클 경우에도 타당한 추론이 보장된다.
  • 영향 함수를 활용하여 포함 확률를 최적화함으로써 TMLE 추정기의 점점 정규 분포를 따르는 분산을 최소화할 수 있다.
  • 엔트로피 및 모멘트 제약 조건을 포함한 약한 정규성 조건 하에서, TMLE의 점점 정규 분포를 달성한다.
  • 시뮬레이션 연구 결과, 전체 데이터 세트가 표준 계산에 비해 너무 클 경우에도 좋은 커버리지와 효율성을 유지함을 보였다.
  • 노출-결과 모델에서 변수 중요도 측정치를 추정하는 데 특히 효과적이며, 강건성과 계산 가능성이 입증되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.