[论文解读] Combining Non-probability and Probability Survey Samples Through Mass Imputation
本文提出一种大规模填补方法,通过利用概率样本中的辅助数据,将非概率样本与概率样本结合,以填补非概率样本中缺失的研究变量。在模型可迁移性假设下(即非概率样本的条件均值函数适用于概率样本),该方法可实现一致估计,并通过线性化或自助法推导渐近方差公式,经模拟研究和皮尤研究中心案例研究验证。
This paper presents theoretical results on combining non-probability and probability survey samples through mass imputation, an approach originally proposed by Rivers (2007) as sample matching without rigorous theoretical justification. Under suitable regularity conditions, we establish the consistency of the mass imputation estimator and derive its asymptotic variance formula. Variance estimators are developed using either linearization or bootstrap. Finite sample performances of the mass imputation estimator are investigated through simulation studies and an application to analyzing a non-probability sample collected by the Pew Research Centre.
研究动机与目标
- 解决由于未知选择机制导致非概率调查样本产生偏差推断的问题。
- 克服非概率抽样中倾向得分估计对总体水平辅助信息的依赖限制。
- 开发一种基于大规模填补的理论基础方法,用于结合非概率与概率样本。
- 在模型可迁移性假设下,建立大规模填补估计量的一致性和渐近方差公式。
- 通过模拟和皮尤研究中心调查的真实世界分析,提供实际指导与实证验证。
提出的方法
- 使用包含观测到的研究变量和辅助变量的非概率样本训练预测模型。
- 将训练好的模型应用于概率样本,以填补其缺失的研究变量,将其视为100%缺失数据集。
- 假设模型可迁移性:非概率样本的条件均值函数适用于概率样本。
- 使用线性化和自助法两种方法推导大规模填补估计量的渐近方差公式。
- 通过在各种抽样和模型配置下的模拟研究验证该方法。
- 将该方法应用于皮尤研究中心的真实非概率调查,将其与概率样本(CPS)结合,用于总体均值估计。
实验结果
研究问题
- RQ1在结合非概率与概率调查样本时,大规模填补能否提供一致且有效的推断?
- RQ2在何种条件下,非概率样本的条件均值函数可迁移至概率样本?
- RQ3在有限样本中,线性化与自助法方差估计器在大规模填补估计量上的表现如何?
- RQ4与逆概率加权法相比,大规模填补在真实世界数据中的实际表现如何?
- RQ5不同类型的辅助变量集合(全部、选定、部分)如何影响大规模填补估计的精度与偏差?
主要发现
- 在模型可迁移性假设下,大规模填补估计量具有一致性,且通过线性化和自助法均推导出渐近方差公式。
- 模拟研究表明,当结果模型设定正确时,大规模填补的均方误差低于逆概率加权法。
- 在皮尤研究中心案例研究中,使用全部辅助变量的大规模填补方法得到的总体均值估计值比IPW更接近真实值。
- 模拟中线性化与自助法方差估计器的覆盖概率相似,但自助法在小样本中表现略优。
- 通过后向剔除法进行变量选择可提高效率,排除非信息性协变量,降低方差而不引入偏差。
- 对于BRFSS调查,使用“Select”模型(选定协变量)的大规模填补方法得到$Y_1$的总体均值估计为0.447,标准误为3.952,而IPW估计为0.443。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。