[论文解读] Integration of survey data and big observational data for finite population inference using mass imputation
本文提出了一种非参数质量插补框架,通过整合概率抽样数据与大规模观测(大数据)数据,以改进有限总体推断。通过使用大数据作为训练集,对整个调查样本中的缺失研究变量进行插补,该方法在无需强参数假设的情况下实现了稳健且高效的估计器,在模型误设和选择偏差条件下,其表现优于现有竞争方法。
Multiple data sources are becoming increasingly available for statistical analyses in the era of big data. As an important example in finite-population inference, we consider an imputation approach to combining a probability sample with big observational data. Unlike the usual imputation for missing data analysis, we create imputed values for the whole elements in the probability sample. Such mass imputation is attractive in the context of survey data integration (Kim and Rao, 2012). We extend mass imputation as a tool for data integration of survey data and big non-survey data. The mass imputation methods and their statistical properties are presented. The matching estimator of Rivers (2007) is also covered as a special case. Variance estimation with mass-imputed data is discussed. The simulation results demonstrate the proposed estimators outperform existing competitors in terms of robustness and efficiency.
研究动机与目标
- 解决将概率抽样数据与大规模、可能存在偏倚的大数据源相结合以进行有限总体推断的挑战。
- 通过将整个调查样本视为需利用大数据作为训练集进行插补的缺失数据,克服传统插补方法的局限性。
- 开发一种基于设计的、非参数的大规模插补框架,避免现有方法中常见的强模型假设。
- 通过利用调查样本的代表性与大数据的预测能力,提升估计效率与稳健性。
- 为大规模插补估计量提供严格的渐近理论与方差估计方法,包括校准加权与非参数插补策略。
提出的方法
- 使用大规模观测数据作为训练数据集,通过大规模插补方法预测概率样本中所有单位的缺失研究变量。
- 实施非参数插补技术:最近邻插补(NNI)、k-最近邻插补(kNNI)与广义可加模型(GAM)。
- 提出一种新型校准加权估计量,通过基于设计的推断,在不依赖模型假设的情况下提升效率。
- 在大规模插补数据上应用Horvitz-Thompson型估计,其方差估计考虑了插补不确定性。
- 在大数据抽样机制满足缺失随机(MAR)假设的前提下,确保理论有效性,采用Rubin的框架。
- 在统一框架内整合多种多重插补策略,以应对异质性并提升对模型误设的稳健性。
实验结果
研究问题
- RQ1如何形式化大规模插补,以将大规模观测数据与概率抽样样本整合,用于有限总体推断?
- RQ2在模型误设条件下,哪些非参数插补方法(如kNNI、GAM)相比参数替代方法能产生更稳健且高效的估计量?
- RQ3校准加权能否适应大规模插补数据,以在不依赖参数模型的情况下实现效率提升?
- RQ4在选择偏差与模型误设条件下,大规模插补方法与现有方法(如IPW、DR)相比表现如何?
- RQ5在基于设计的框架下,大规模插补估计量的渐近性质与方差估计策略是什么?
主要发现
- 所提出的大型插补方法,尤其是kNNI与GAM,在模型误设条件下显著优于现有竞争方法,在稳健性与效率方面表现更优。
- 校准加权估计量在估计效率方面优于其他方法,且即使在结果或倾向得分模型误设时仍保持稳健。
- 最近邻插补(NNI)与kNNI在所有情景下均表现出稳定性能,偏差低于0.1×10²,置信区间覆盖率接近96%。
- 当所有调查单位的大数据成员身份已知时,回归校准估计量保持高效率(标准误≈3.7×10²)与良好覆盖(95.8%–96.6%)。
- IPW估计量对模型误设高度敏感,在非线性倾向模型下覆盖率下降至1.8%,而DR估计量表现出更好的稳健性。
- 基于真实美国人口普查数据的模拟结果表明,当大数据抽样机制非忽略(非MAR)时,若MAR假设成立,使用非参数模型的大规模插补仍能保持低偏差与高覆盖。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。