Skip to main content
QUICK REVIEW

[논문 리뷰] Exploring the big data paradox for various estimands using vaccination data from the global COVID-19 Trends and Impact Survey (CTIS)

Youqi Yang, Walter Dempsey|arXiv (Cornell University)|2023. 06. 26.
COVID-19 epidemiological studiesMathematics인용 수 3
한 줄 요약

이 연구는 인도의 황금표준 CoWIN 데이터와 비교하여 세계적 비확률 설문조사인 대규모 비확률 설문조사 CTIS와 소규모 확률 설문조사인 CVoter의 코로나19 1차 접종률 추정치를 분석함으로써 비확률 설문조사에서의 빅데이터 역설을 조사한다. CTIS의 추정 오차가 더 높음(0.39 대 0.16)에도 불구하고, 추정 대상(estimand)을 절대 비율이 아닌 상대적 변화 또는 하위집단 간 차이로 재정의할 경우 편향이 크게 감소하고 유효 표본 크기가 증가함을 보여주며, 이는 빅데이터 설문조사가 절대 유병률이 아닌 비교적 추세 분석에 적절히 활용될 경우 여전히 유의미한 통찰을 제공할 수 있음을 시사한다.

ABSTRACT

Selection bias poses a challenge to statistical inference validity in non-probability surveys. This study compared estimates of the first-dose COVID-19 vaccination rates among Indian adults in 2021 from a large non-probability survey, COVID-19 Trends and Impact Survey (CTIS), and a small probability survey, the Center for Voting Options and Trends in Election Research (CVoter), against benchmark data from the COVID Vaccine Intelligence Network (CoWIN). Notably, CTIS exhibits a larger estimation error (0.39) compared to CVoter (0.16). Additionally, we investigated the estimation accuracy of the CTIS when using a relative scale and found a significant increase in the effective sample size by altering the estimand from the overall vaccination rate. These results suggest that the big data paradox can manifest in countries beyond the US and it may not apply to every estimand of interest.

연구 동기 및 목표

  • 미국과 다른 의료 및 인구 구조를 지닌 국가인 인도에서, 대규모 비확률 표본이 더 높은 추정 오차를 보이는 빅데이터 역설이 적용되는지 평가하는 것.
  • 인도의 공식 CoWIN 기준 데이터와 비교하여 CTIS(비확률 설문조사)와 CVoter(확률 설문조사)가 제시한 1차 코로나19 접종률 추정 정확도를 비교하는 것.
  • 절대 접종률에서 상대적 변화 또는 하위집단 간 차이로 추정 대상을 재정의할 경우 비확률 설문조사에서 편향을 완화하고 유효 표본 크기를 향상시킬 수 있는지 조사하는 것.
  • 절대 추정치에 편향이 있음에도 불구하고, CTIS와 같은 대규모 비확률 설문조사가 시간에 따른 추세 및 하위집단 간 격차를 모니터링하는 데 얼마나 유용한지 평가하는 것.

제안 방법

  • Meng(2018)의 분해 프레임워크를 사용하여 추정 오차를 세 가지 구성요소로 분할: 자료 결함 상관관계(ddc), 자료 부족, 본질적 문제 난이도.
  • 인도 성인의 1차 접종률에 대해 설문조사 추정치와 CoWIN 기준치 간의 제곱차를 추정 오차로 계산.
  • 다음 공식을 사용해 유효 표본 크기를 계산: $ n_{eff} = \frac{n}{1 + \rho_{Y,R} \sqrt{\frac{N - n}{n}} \cdot \frac{\sigma_Y}{\overline{Y}_N} } $, 여기서 $ \rho_{Y,R} $는 응답 유무와 결과 간 상관계수.
  • 전체 접종률에서 연속적인 변화(상대적 변화) 및 하위집단 간 차이(예: 성별)로 추정 대상을 재정의하고, 편향과 유효 표본 크기를 재계산.
  • 연령, 성별, 지역 등의 인구통계학적 변수를 사용해 가중치 조정 및 기준화를 수행하여 설문조사 표본이 모집단 분포와 일치하도록 조정.
  • CTIS와 CDC/CoWIN 데이터를 모두 사용해 시간적 추세 분석을 수행하고, 변화점 탐지 정확도를 설문조사 간 비교.
Figure 1: Figure 1. Decomposition of the estimation error and the effective sample size of vaccine uptake in India. (A) Estimate, (B) estimation error, (c) inherent problem difficulty, (D) data deficiency, (E) data defect correlation, (F) effective sample size, and (G) reduction in the sample size o
Figure 1: Figure 1. Decomposition of the estimation error and the effective sample size of vaccine uptake in India. (A) Estimate, (B) estimation error, (c) inherent problem difficulty, (D) data deficiency, (E) data defect correlation, (F) effective sample size, and (G) reduction in the sample size o

실험 결과

연구 질문

  • RQ1이전에 미국 설문조사에서 관찰된 바 있는 빅데이터 역설이, 미국 외의 고인구 국가인 인도에서도 나타나는가?
  • RQ2인도에서 1차 코로나19 접종률을 추정할 때 CTIS의 추정 오차는 소규모 확률 설문조사(CVoter)와 비교해 어떻게 되는가?
  • RQ3비확률 설문조사에서 절대 접종률에서 상대적 변화 또는 하위집단 간 차이로 추정 대상을 재정의할 경우 편향 감소와 유효 표본 크기 증가에 기여하는가?
  • RQ4선택 편향이 존재함에도 불구하고 CTIS 데이터가 백신 접종률의 시간적 추세와 하위집단 격차를 얼마나 정확히 반영하는가?
  • RQ5자료 결함 상관관계(ddc)는 대규모 비확률 설문조사에서 추정 오차와 유효 표본 크기에 어떤 영향을 미치는가?

주요 결과

  • 인도에서 1차 접종률을 추정할 때 CTIS 설문조사의 추정 오차(0.39)는 CVoter 설문조사(0.16)보다 높았으며, 이는 비미국적 맥락에서도 빅데이터 역설이 존재함을 확인한다.
  • 추정 대상을 절대 접종률에서 연속적인 변화(상대적 변화)로 변경한 결과 유효 표본 크기가 크게 증가하여 편향 감소와 정밀도 향상이 이루어짐을 시사한다.
  • 하위집단 간 차이 추정치(예: 성별 격차) 역시 편향 감소와 높은 유효 표본 크기를 보였으며, 이는 빅데이터 설문조사가 비교 분석 및 추세 분석에 유용할 수 있음을 시사한다.
  • 자료 결함 상관관계(ddc)는 주요 편향 원인으로서 작용하였으며, 큰 표본에서 이 영향이 더욱 두드러져, 빅비확률 설문조사에서 편향이 분산보다 더 큰 역할을 함을 확인한다.
  • 높은 절대 편향에도 불구하고 CTIS 데이터는 공식 데이터와 일치하는 변화점 탐지가 가능한 수준의 정밀도로 시간에 따른 접종률 추세를 잘 반영하였다.
  • 이 연구는 비확률 설문조사인 CTIS가 절대 유병률이 아닌 상대적 또는 비교적 추정 대상에 적절히 활용될 경우 공중보건 모니터링에 여전히 유의미한 통찰을 제공할 수 있음을 입증한다.
Figure 2: Figure 2. The successive difference and relative successive difference of vaccine uptake in the US ((A) and (B)) and India ((C) and (D)). (A) The estimate and (B) effective sample size of the overall rate (blue, solid), the successive difference (blue, dashed), and the relative successive
Figure 2: Figure 2. The successive difference and relative successive difference of vaccine uptake in the US ((A) and (B)) and India ((C) and (D)). (A) The estimate and (B) effective sample size of the overall rate (blue, solid), the successive difference (blue, dashed), and the relative successive

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.