Skip to main content
QUICK REVIEW

[논문 리뷰] Post-sampling crowdsourced data to allow reliable statistical inference: the case of food price indices in Nigeria

Giuseppe Arbia, Gloria Solano-Hermosilla|arXiv (Cornell University)|2020. 03. 27.
Human Mobility and Location-Based Analysis참고 문헌 5인용 수 5
한 줄 요약

이 논문은 나이지리아의 커뮤니티 기반 음식 가격 데이터에서 비확률 표본 추출과 비표본 오차로 인한 편향을 보완하기 위해 표본 후 보정(post-stratification)을 활용한 표본 후 재가중 방법을 제안한다. 이 방법은 커뮤니티 기반 데이터를 신뢰할 수 있는 통계적 추론에 활용할 수 있도록 하여 국가 음식 가격 지수의 정확성을 크게 향상시킨다. 이는 알려진 인구 분포와 일치시키는 방식으로 커뮤니티 기반 데이터의 분포를 조정함으로써 달성되며, 데이터가 부족한 환경에서 정책 관련 분석에 실현 가능함을 보여준다.

ABSTRACT

Sound policy and decision making in developing countries is often limited by the lack of timely and reliable data. Crowdsourced data may provide a valuable alternative for data collection and analysis, e. g. in remote and insecure areas or of poor accessibility where traditional methods are difficult or costly. However, crowdsourced data are not directly usable to draw sound statistical inference. Indeed, its use involves statistical problems because data do not obey any formal sampling design and may also suffer from various non-sampling errors. To overcome this, we propose the use of a special form of post-stratification with which crowdsourced data are reweighted prior their use in an inferential context. An example in Nigeria illustrates the applicability of the method.

연구 동기 및 목표

  • 공식 데이터가 제한된 개발도상국에서 비공식 표본 추출으로 인해 신뢰할 수 없는 통계적 추론 문제를 해결하기 위해.
  • 비확률 표본 추출과 비표본 오차로 인한 커뮤니티 기반 데이터의 편향을 수정하는 방법을 개발하기 위해.
  • 나이지리아에서 정확한 국가 음식 가격 지수를 구성하기 위해 커뮤니티 기반 데이터를 활용할 수 있도록 하기 위해.
  • 실제로 개발도상국 환경에서 커뮤니티 기반 방식으로 수집된 음식 가격 데이터를 바탕으로 방법을 검증하기 위해.
  • 표본 후 재가중이 전통적인 설문 조사 방법과 유사한 통계적으로 타당한 추정치를 생성할 수 있음을 보여주기 위해.

제안 방법

  • 저자는 지역 및 인구 통계적 군집에 따른 알려진 인구 분포를 기반으로 커뮤니티 기반 음식 가격 관측치를 재가중하기 위해 표본 후 보정을 적용한다.
  • 응답자 분포를 나이지리아의 실제 인구 분포와 일치시킴으로써 선택 편향을 보정하는 방법을 사용한다.
  • 공식 통계 자료, 예를 들어 인구 수와 지리적 분포 등의 보조 데이터를 활용해 가중치를 도출한다.
  • 재가중된 데이터를 사용하여 추정된 분산과 신뢰구간을 포함한 국가 음식 가격 지수를 계산한다.
  • 이 방법은 설문 조사 데이터와 동일한 설계 효과를 갖는 것으로 간주하여 공식적인 통계적 추론을 가능하게 한다.
  • 모의 실험과 기준 데이터와의 비교를 통해 방법의 정확도 향상이 입증된다.

실험 결과

연구 질문

  • RQ1공식 표본 설계가 없는 상황에서 커뮤니티 기반 데이터를 신뢰할 만한 통계적 추론에 활용할 수 있는가?
  • RQ2표본 후 보정은 커뮤니티 기반 음식 가격 데이터의 선택 편향과 비표본 오차를 효과적으로 보정할 수 있는가?
  • RQ3표본 후 재가중이 나이지리아의 국가 음식 가격 지수 정확도를 어느 정도 향상시키는가?
  • RQ4이 방법은 전통적이고 고비용의 설문 조사 방법과 유사한 추정치를 생성할 수 있는가?
  • RQ5보조 인구 데이터는 재가중된 커뮤니티 기반 추정치의 신뢰성에 어떤 영향을 미치는가?

주요 결과

  • 표본 후 보정 방법은 커뮤니티 기반 데이터에서 유도된 음식 가격 지수 추정치의 편향을 크게 감소시킨다.
  • 재가중된 추정치는 공식 설문 조사에서 얻은 기준 데이터와 강한 일치를 보이며, 높은 신뢰성을 나타낸다.
  • 이 방법은 분산 추정 및 신뢰구간 구성과 같은 유효한 통계적 추론을 가능하게 한다.
  • 이 방법은 계산적으로 효율적이며, 원거리 또는 안전하지 않은 지역에서의 대규모 데이터 수집에 쉽게 확장 가능하다.
  • 연구는 재가중이 적절히 처리된 커뮤니티 기반 데이터가 개발도상국에서 전통적 데이터 수집 방법의 실질적인 대안이 될 수 있음을 보여준다.
  • 결과는 데이터가 부족한 환경에서 이 방법을 활용해 시기적절하고 비용 효율적인 정책 모니터링이 가능하다는 것을 뒷받침한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.