[논문 리뷰] Combining Non-probability and Probability Survey Samples Through Mass Imputation
이 논문은 비확률 표본의 누락된 연구 변수를 보정하기 위해 확률 표본의 보조 데이터를 활용하여 비확률 표본과 확률 표본을 통합하는 질량 보정 방법을 제안한다. 비확률 표본의 조건부 평균 함수가 확률 표본에도 적용된다는 모델 이행성 가정 하에, 이 방법은 일致된 추정을 보장하고 선형화 또는 부트스트랩을 사용하여 점차적 분산 공식을 도출하며, 시뮬레이션과 Pew Research Center 사례 연구를 통해 검증된다.
This paper presents theoretical results on combining non-probability and probability survey samples through mass imputation, an approach originally proposed by Rivers (2007) as sample matching without rigorous theoretical justification. Under suitable regularity conditions, we establish the consistency of the mass imputation estimator and derive its asymptotic variance formula. Variance estimators are developed using either linearization or bootstrap. Finite sample performances of the mass imputation estimator are investigated through simulation studies and an application to analyzing a non-probability sample collected by the Pew Research Centre.
연구 동기 및 목표
- 모르는 선택 메커니즘으로 인해 비확률 표본에서 편향된 추론이 발생하는 문제를 다루기.
- 비확률 표본에서 경향 스코어 추정을 위해 인구 수준의 보조 정보가 필요하다는 한계를 극복하기.
- 질량 보정을 통해 비확률 표본과 확률 표본을 이론적으로 타당한 방법으로 통합하는 방법 개발하기.
- 모델 이행성 하에서 질량 보정 추정량의 일관성과 점차적 분산 공식 수립하기.
- 시뮬레이션과 실제 데이터 분석(예: Pew Research Center 설문조사)을 통한 실용적 지침과 실증적 검증 제공하기.
제안 방법
- 관측된 연구 변수와 보조 변수를 포함한 비확률 표본을 사용하여 예측 모델을 학습하기.
- 학습된 모델을 확률 표본의 누락된 연구 변수에 적용하여, 이를 100% 누락 데이터로 간주하고 보정하기.
- 모델 이행성 가정: 비확률 표본의 조건부 평균 함수가 확률 표본에도 유효하다고 가정하기.
- 선형화 및 부트스트랩 방법을 사용하여 질량 보정 추정량의 점차적 분산 공식 유도하기.
- 다양한 표본 추출 및 모델 설정 하에서 시뮬레이션 연구를 통해 방법 검증하기.
- 실제 Pew Research Center 비확률 설문조사에 방법을 적용하여, 이를 확률 표본(CPS)과 통합하여 인구 평균 추정하기.
실험 결과
연구 질문
- RQ1비확률 표본과 확률 표본을 통합할 때 질량 보정이 일관되고 타당한 추론을 제공할 수 있는가?
- RQ2비확률 표본의 조건부 평균 함수가 확률 표본으로 이행되기 위한 조건은 무엇인가?
- RQ3유한 표본에서 질량 보정 추정량의 선형화 및 부트스트랩 분산 추정량은 어떻게 성능을 보이는가?
- RQ4실제 데이터에서 질량 보정의 실증적 성능은 역확률가중법(IPW)에 비해 어떻게 되는가?
- RQ5모든, 선택된, 부분적인 보조 변수 집합을 사용할 경우 질량 보정 추정의 정밀도와 편향에는 어떤 영향을 미치는가?
주요 결과
- 모델 이행성 가정 하에서 질량 보정 추정량은 일관성이 있으며, 선형화 및 부트스트랩 방법을 통해 점차적 분산 공식이 도출되었다.
- 시뮬레이션 연구 결과, 결과 변수 모델이 잘 지정된 경우 질량 보정이 역확률가중법보다 더 낮은 평균제곱오차를 보였다.
- Pew Research Center 사례 연구에서 전체 보조 변수를 사용한 질량 보정은 IPW보다 진짜 값에 더 가까운 인구 평균 추정치를 도출하였다.
- 시뮬레이션에서 선형화 및 부트스트랩 분산 추정량은 유사한 커버리지 비율을 보였으며, 소수 표본에서는 부트스트랩이 略적으로 더 우수한 성능을 보였다.
- 역방향 제거를 통한 변수 선택은 비정보성 공변수를 제거하여 효율성을 향상시켰으며, 편향을 유발하지 않고 분산을 감소시켰다.
- BRFSS 설문조사에서 '선택된 모델'(선택된 공변수)을 사용한 질량 보정은 $Y_1$에 대해 인구 평균 추정치 0.447과 표준오차 3.952를 도출하였으며, IPW는 0.443을 기록하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.