[论文解读] Exploring the big data paradox for various estimands using vaccination data from the global COVID-19 Trends and Impact Survey (CTIS)
本研究通过将印度全球CTIS(一项大规模非概率调查)和小规模概率调查CVoter的疫苗接种率估计值与金标准CoWIN数据对比,探讨了非概率调查中的大数据悖论。尽管CTIS的估计误差更高(0.39 vs. 0.16),但研究显示,将估计目标重新定义为相对变化或子群差异可显著降低偏差并提高有效样本量,表明当大样本数据调查被适当地用于比较趋势而非绝对患病率时,仍能提供有价值的见解。
Selection bias poses a challenge to statistical inference validity in non-probability surveys. This study compared estimates of the first-dose COVID-19 vaccination rates among Indian adults in 2021 from a large non-probability survey, COVID-19 Trends and Impact Survey (CTIS), and a small probability survey, the Center for Voting Options and Trends in Election Research (CVoter), against benchmark data from the COVID Vaccine Intelligence Network (CoWIN). Notably, CTIS exhibits a larger estimation error (0.39) compared to CVoter (0.16). Additionally, we investigated the estimation accuracy of the CTIS when using a relative scale and found a significant increase in the effective sample size by altering the estimand from the overall vaccination rate. These results suggest that the big data paradox can manifest in countries beyond the US and it may not apply to every estimand of interest.
研究动机与目标
- 评估大数据悖论——即大规模非概率样本的估计误差高于小规模概率样本——是否适用于印度,一个其医疗体系和人口结构与美国不同的国家。
- 将印度CTIS(非概率调查)和CVoter(概率调查)在首剂新冠疫苗接种率上的估计值与官方CoWIN基准数据进行比较,评估估计准确性。
- 调查是否可通过将估计目标从绝对疫苗接种率重新定义为相对变化或子群差异,来减轻非概率调查中的偏差并提高有效样本量。
- 评估像CTIS这样的大规模非概率调查在追踪疫苗接种率的时间趋势和子群差异方面的实用性,即使其绝对估计存在偏差。
提出的方法
- 采用Meng(2018)提出的分解框架,将估计误差划分为三个组成部分:数据缺陷相关性(ddc)、数据不足和固有问题难度。
- 将估计误差计算为调查估计值与印度成年人首剂疫苗接种率CoWIN基准值之间的平方差。
- 使用公式计算有效样本量:$ n_{eff} = \frac{n}{1 + \rho_{Y,R} \sqrt{\frac{N - n}{n}} \cdot \frac{\sigma_Y}{\overline{Y}_N} } $,其中 $ \rho_{Y,R} $ 为响应指示变量与结果之间的相关性。
- 将估计目标从总体疫苗接种率重新定义为连续差异(相对变化)和子群差异(如性别差异),并重新计算偏差和有效样本量。
- 使用人口统计变量(年龄、性别、地区)进行加权和基准校准,使调查样本与人口分布保持一致。
- 进行时间序列分析,利用CTIS和CDC/CoWIN数据检测疫苗接种率的变化点,比较不同调查在检测准确性方面的表现。

实验结果
研究问题
- RQ1此前在美国内部观察到的大数据悖论,是否也存在于印度这样的非美国高人口国家?
- RQ2在估计印度首剂疫苗接种率时,CTIS的估计误差与小规模概率调查(CVoter)相比如何?
- RQ3是否可通过将估计目标从绝对疫苗接种率重新定义为相对变化或子群差异,来降低非概率调查中的偏差并提高有效样本量?
- RQ4尽管存在选择偏差,CTIS数据在多大程度上能准确捕捉疫苗接种率的时间趋势和子群差异?
- RQ5数据缺陷相关性(ddc)对大规模非概率调查中的估计误差和有效样本量有何影响?
主要发现
- 在估计印度首剂疫苗接种率时,CTIS调查的估计误差(0.39)高于CVoter调查(0.16),证实了大数据悖论在非美国语境下的存在。
- 当估计目标从绝对疫苗接种率更改为相对变化(连续差异)时,有效样本量显著增加,表明偏差降低且精度提高。
- 子群差异估计目标(如性别差异)也表现出更低的偏差和更高的有效样本量,表明大样本调查在比较分析和趋势研究中仍具实用性。
- 数据缺陷相关性(ddc)是主要的偏差来源,其影响在大样本中被放大,证实了在大样本非概率调查中,偏差而非方差主导了均方误差。
- 尽管绝对偏差较高,CTIS数据仍以合理精度捕捉了疫苗接种率的时间趋势,包括与官方数据一致的变点检测。
- 本研究证明,当非概率调查如CTIS被适当地用于相对或比较性估计目标而非绝对患病率时,仍能为公共卫生监测提供有价值的见解。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。