[论文解读] Sampling techniques for big data analysis in finite population inference
本文提出了两种用于大规模数据有限总体推断的偏差校正抽样技术:利用外部辅助数据的逆抽样方法,以及通过倾向得分加权实现数据整合的独立概率样本方法。两种方法均能有效降低选择偏差,获得无偏估计并提升覆盖率,在模拟研究中优于其他替代方法。
In analyzing big data for finite population inference, it is critical to adjust for the selection bias in the big data. In this paper, we propose two methods of reducing the selection bias associated with the big data sample. The first method uses a version of inverse sampling by incorporating auxiliary information from external sources, and the second one borrows the idea of data integration by combining the big data sample with an independent probability sample. Two simulation studies show that the proposed methods are unbiased and have better coverage rates than their alternatives. In addition, the proposed methods are easy to implement in practice.
研究动机与目标
- 解决在对有限总体进行推断时,大规模数据样本中选择偏差带来的关键挑战。
- 开发实用且可实施的方法,以调整选择偏差,而无需依赖完整的概率抽样。
- 提出两种不同的方法——逆抽样与数据整合——利用辅助信息和独立概率样本。
- 确保所提出的方法能够产生无偏估计量,并在频繁覆盖方面优于现有替代方法。
- 通过有限但具有信息量的模拟研究,证明方法的有效性。
提出的方法
- 提出一种新颖的逆抽样方法,利用外部来源的辅助信息,从非概率的大规模数据样本中生成代表性样本。
- 应用两阶段抽样原理,根据从辅助变量中估计的纳入概率,对大规模数据单位进行重加权。
- 引入一种数据整合框架,将大规模数据样本与独立概率样本结合,以估计倾向得分。
- 使用双重稳健估计量,结合结果回归模型与倾向得分模型,确保在任一模型正确设定时均保持一致性。
- 利用基于概率样本中估计倾向得分的逆概率加权方法,估计总体均值,从而校正大规模数据样本中的选择偏差。
- 采用双重稳健估计量对总体均值进行估计,即使在模型设定错误时仍保持一致性,从而增强稳健性。
实验结果
研究问题
- RQ1利用辅助数据的逆抽样方法能否有效降低大规模数据样本在有限总体推断中的选择偏差?
- RQ2通过独立概率样本进行数据整合在大规模数据环境中能否提升估计精度?
- RQ3所提出的方法是否能产生比现有替代方法更优的无偏估计量与更高的覆盖率?
- RQ4在模型设定错误的有限样本设置下,双重稳健估计量的表现如何?
- RQ5在不同选择偏差程度下,所提出方法在均方误差与覆盖率方面的表现如何比较?
主要发现
- 逆抽样方法通过整合辅助信息,成功降低了选择偏差,使大规模数据样本更具代表性。
- 利用倾向得分加权的数据整合方法在结果回归模型或倾向得分模型任一正确设定时,均能实现无偏估计。
- 在模拟研究中,两种所提方法的覆盖率均显著优于传统估计量。
- 即使在结果回归模型或倾向得分模型中有一个被错误设定时,双重稳健估计量仍能保持一致性。
- 这些方法在计算上简单且易于实际应用,适用于现实世界调查场景。
- 模拟结果证实,在存在选择偏差的情况下,所提方法的均方误差更低,覆盖率更优,优于标准估计量。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。