Skip to main content
QUICK REVIEW

[논문 리뷰] Doubly Robust Inference With Nonprobability Survey Samples

Yilin Chen, Pengfei Li|arXiv (Cornell University)|2018. 05. 16.
Statistical Methods and Bayesian Inference참고 문헌 17인용 수 15
한 줄 요약

이 논문은 확률 조사에서 확보한 보조 데이터를 활용하여 비확률 조사 표본에 대한 이중 강건 추론 프레임워크를 제안한다. 선택 확률를 추정하고, 역확률가중법과 회귀 校正을 결합함으로써, 선택 모형 또는 결과 모형 중 하나가 잘못 지정되어도 유한 모집단 평균에 대한 일致 추정이 보장되며, 시뮬레이션과 실제 데이터 검증을 통해 더 높은 강건성과 효율성을 입증한다.

ABSTRACT

We establish a general framework for statistical inferences with nonprobability survey samples when relevant auxiliary information is available from a probability survey sample. We develop a rigorous procedure for estimating the propensity scores for units in the nonprobability sample, and construct doubly robust estimators for the finite population mean. Variance estimation is discussed under the proposed framework. Results from simulation studies show the robustness and the efficiency of our proposed estimators as compared to existing methods. The proposed method is used to analyze a nonprobability survey sample collected by the Pew Research Center with auxiliary information from the Behavioral Risk Factor Surveillance System and the Current Population Survey. Our results illustrate a general approach to inference with nonprobability samples and highlight the importance and usefulness of auxiliary information from probability survey samples. Supplementary materials for this article are available online.

연구 동기 및 목표

  • 비확률 조사 표본에서의 타당한 통계적 추론을 수행하는 데 도전하는 것. 이는 포함 확률가 알려져 있지 않으며 선택 편향에 노출되어 있기 때문이다.
  • 기준 확률 표본에서 제공되는 보조 정보를 바탕으로 선택 확률를 추정하는 엄밀한 프레임워크를 개발하는 것.
  • 선택 확률 모형 또는 결과 회귀 모형 중 하나만 올바르게 지정되어도 일관된 추정이 보장되는, 유한 모집단 평균에 대한 이중 강건 추정량을 구성하는 것.
  • 제안된 프레임워크 하에서 신뢰할 수 있는 추론을 위한 타당한 분산 추정 절차를 제공하는 것.

제안 방법

  • 비확률 표본의 단위에 대한 선택 확률를 추정하기 위해 확률 조사에서 확보한 보조 데이터를 활용하는 일반적 프레임워크를 제안한다.
  • 두 단계 추정 절차를 개발한다: 첫째, 확률 표본의 보조 변수를 바탕으로 로지스틱 회귀 모형을 사용해 선택 확률를 추정한다.
  • 추정된 선택 확률를 활용해 결과 잔차의 역확률가중법과 회귀 校正을 결합하여 유한 모집단 평균에 대한 이중 강건(DR) 추정량을 구성한다.
  • 모형 기반 성분에 대해 하제크 유형 추정량을 사용하여 보조 표본의 확률 표집 설계 하에서 설계 일관성을 확보한다.
  • 표본 변동성과 모형 추정 불확실성을 모두 고려한 점근적 분산 추정량을 유도한다.
  • 보조 데이터로 보조 건강 위험 요인 감시 체계(Behavioral Risk Factor Surveillance System, BRFSS)와 현재 인구 조사(Current Population Survey, CPS)를 활용하여 페우 연구 센터의 실제 데이터에 방법을 적용한다.

실험 결과

연구 질문

  • RQ1비확률 조사 데이터만 제공되고 보조 데이터로 확률 표본에서 유래한 정보만 확보 가능한 상황에서, 유한 모집단 평균에 대한 이중 강건 추정량을 구성할 수 있는가?
  • RQ2확률 표본의 보조 변수를 활용해 비확률 표본 단위의 선택 확률를 신뢰성 있게 추정할 수 있는가?
  • RQ3선택 확률 모형 또는 결과 회귀 모형 중 하나가 잘못 지정되어도 제안된 이중 강건 추정량이 일관성을 유지하는가?
  • RQ4편향, 평균제곱오차 및 신뢰구간 커버리지 측면에서 기존 방법과 비교해 제안된 추정량의 유한 표본 성능은 어떠한가?
  • RQ5제안된 프레임워크 하에서 타당한 분산 추정을 어떻게 달성할 수 있는가?

주요 결과

  • 제안된 이중 강건 추정량은 선택 확률 모형 또는 결과 회귀 모형 중 하나만 올바르게 지정되어도 모집단 평균에 대한 일관성을 확보하여, 모형 잘못 지정에 대한 강건성을 보장한다.
  • 시뮬레이션 연구 결과, 제안된 추정량은 기존 방법보다 더 낮은 평균제곱오차와 더 나은 커버리지 비율을 보이며, 특히 결과 모형이 올바르게 지정된 경우에 두드러진 성능 향상을 보였다.
  • 선택 확률 모형이 잘못 지정되어도 추정량이 양호한 성능을 유지하여, 이중 강건 성질의 가치를 입증하였다.
  • 제안된 프레임워크 하에서의 분산 추정은 타당하며 표본 설계와 모형 추정 불확실성을 모두 반영하여 정확한 신뢰구간을 지원한다.
  • BRFSS와 CPS의 보조 데이터를 활용해 페우 연구 센터의 비확률 조사에 적용한 결과, 방법은 모집단 평균에 대한 신뢰할 수 있고 효율적인 추정치를 도출하였다.
  • 결과는 확률 표본에서 유래한 보조 데이터가 비확률 조사에서의 신뢰할 수 있는 추론을 가능하게 하는 데 핵심적인 역할을 한다는 점을 강조한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.