Skip to main content
QUICK REVIEW

[논문 리뷰] Data Integration by combining big data and survey sample data for finite population inference

Jaekwang Kim, Siu‐Ming Tam|arXiv (Cornell University)|2020. 03. 26.
Survey Methodology and Nonresponse참고 문헌 24인용 수 7
한 줄 요약

이 논문은 유한 모집단 추론을 위해 missing-at-random (MAR) 가정에 의존하지 않고 대용량 데이터와 설문 표본 데이터를 통합하는 방법을 제안한다. 대용량 데이터를 측정 오차가 있는 유한 모집단으로 간주하고, 校정 가중치와 비모수적 분류를 사용하여 선택 편향과 오분류를 보정함으로써 일반적인 선택 메커니즘 하에서 일致한 추정을 달성한다.

ABSTRACT

The statistical challenges in using big data for making valid statistical inference in the finite population have been well documented in literature. These challenges are due primarily to statistical bias arising from under-coverage in the big data source to represent the population of interest and measurement errors in the variables available in the data set. By stratifying the population into a big data stratum and a missing data stratum, we can estimate the missing data stratum by using a fully responding probability sample, and hence the population as a whole by using a data integration estimator. By expressing the data integration estimator as a regression estimator, we can handle measurement errors in the variables in big data and also in the probability sample. We also propose a fully nonparametric classification method for identifying the overlapping units and develop a bias-corrected data integration estimator under misclassification errors. Finally, we develop a two-step regression data integration estimator to deal with measurement errors in the probability sample. An advantage of the approach advocated in this paper is that we do not have to make unrealistic missing-at-random assumptions for the methods to work. The proposed method is applied to the real data example using 2015-16 Australian Agricultural Census data.

연구 동기 및 목표

  • 유한 모집단 모수를 추정할 때 대용량 데이터 자료의 선택 편향과 측정 오차 문제를 다루기.
  • 기존의 가중치 및 보간 방법에서 흔히 사용되는 missing-at-random (MAR) 가정의 한계를 극복하기.
  • 완전히 응답한 확률 표본을 활용하여 누락된 자료의 군집을 추정하고 전체 유한 모집단에 대한 추론을 향상시키는 데이터 통합 프레임워크 개발하기.
  • 대용량 데이터 및 설문 표본 변수의 측정 오차를 회귀 기반 校정과 이중 단계 추정을 통해 다루기.
  • 정확한 매칭이 불가능할 경우 대용량 데이터와 설문 표본 간의 겹치는 단위를 식별하기 위한 비모수적 분류 방법 제공하기.

제안 방법

  • 유한 모집단을 대용량 데이터 군집(카버리지 오차 및 측정 오차 존재)과 누락된 자료 군집(확률 표본을 통해 추정)으로 분류하기.
  • 측정 오차를 보정하기 위해 데이터 통합 추정량을 회귀 추정량으로 표현하기.
  • 대용량 데이터와 설문 표본 간의 겹치는 단위를 식별하기 위해 반감독 비모수적 분류 방법을 사용하여 성향 스코어 추정하기.
  • 겹치는 단위 식별 과정에서의 오분류 오차를 고려한 편향 보정 데이터 통합 추정량 제안하기.
  • 측정 오차가 있는 확률 표본을 다루기 위해 두 단계 추정량을 개발하여 정확도와 강건성을 향상시키기.
  • 대용량 데이터 자료의 보조 정보를 사용하여 校정 가중치를 적용하여 추정 효율성 향상과 편향 감소하기.

실험 결과

연구 질문

  • RQ1대용량 데이터 자료가 부족한 커버리지와 측정 오차를 앓을 경우, 어떻게 유효한 유한 모집단 추론을 수행할 수 있는가?
  • RQ2선택 편향 보정에 missing-at-random (MAR) 가정에 의존하지 않는 데이터 통합 방법을 개발할 수 있는가?
  • RQ3정확한 매칭이 불가능할 경우 대용량 데이터와 설문 표본 간의 겹치는 단위를 효과적으로 식별하는 방법은 무엇인가?
  • RQ4통합된 데이터 통합 프레임워크 내에서 대용량 데이터 및 설문 표본의 측정 오차를 어떻게 보정할 수 있는가?
  • RQ5겹치는 단위 식별 과정에서의 오분류가 결과 추정량의 편향과 분산에 미치는 영향은 무엇인가?

주요 결과

  • 제안된 방법은 일반적인 선택 메커니즘 하에서 MAR 가정이 필요 없이 일致한 추정을 달성한다. 이는 실무에서 자주 검증이 어려운 가정이다.
  • 비모수적 분류 방법은 정확한 매칭이 불가능하더라도 대용량 데이터와 설문 표본 간의 겹치는 단위를 성공적으로 식별한다.
  • 편향 보정 데이터 통합 추정량은 겹치는 단위 식별 과정에서의 오분류로 인한 편향을 효과적으로 감소시킨다.
  • 두 단계 회귀 추정량은 확률 표본에 측정 오차가 존재할 경우 정확도와 강건성을 향상시킨다.
  • 분산 추정은 타일러 선형화와 校정 기반의 설계 기반 추론을 통해 수행되며, 질량 보간 및 校정 기반 추정량에 대해 일致한 분산 추정량이 유도되었다.
  • 2015–16 호주 농업 인구 조사 데이터에 대한 응용은 이 방법의 공식 통계 제작 분야에서의 실용적 유용성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.