Skip to main content
QUICK REVIEW

[论文解读] Probability and Non-Probability Samples: Improving Regression Modeling by Using Data from Different Sources

Gerhard Tutz|arXiv (Cornell University)|Apr 3, 2022
Forecasting Techniques and Applications被引用 5
一句话总结

本文提出一种方法,通过利用回归残差识别并整合可能来自目标总体的非概率样本数据,将非概率样本数据融入概率样本,以改进回归系数估计。通过利用诊断残差和改进的自助法技术,该方法降低了标准误并提高了估计精度,尤其在整合相似总体(如邻近国家)的数据时效果显著。

ABSTRACT

Non-probability sampling, for example in the form of online panels, has become a fast and cheap method to collect data. While reliable inference tools are available for classical probability samples, non-probability samples can yield strongly biased estimates since the selection mechanism is typically unknown. We propose a general method how to improve statistical inference when in addition to a probability sample data from other sources, which have to be considered non-probability samples, are available. The method uses specifically tailored regression residuals to enlarge the original data set by including observations from other sources that can be considered as stemming from the target population. Measures of accuracy of estimates are obtained by adapted bootstrap techniques. It is demonstrated that the method can improve estimates in a wide range of scenarios. For illustrative purposes, the proposed method is applied to two data sets.

研究动机与目标

  • 解决由于未知选择机制导致的非概率样本带来的估计偏差问题。
  • 开发一种方法,在拥有代表性概率样本的前提下,通过整合非概率来源的数据来改进回归系数估计。
  • 提供一种可靠的框架,利用改进的自助法技术估计标准误。
  • 在多样化数据情景(包括跨国调查数据)中展示该方法的有效性。

提出的方法

  • 利用概率样本的回归残差评估非概率样本观测值与目标总体的相似性。
  • 基于残差模式将非概率样本观测值分类为可能来自目标总体,无需标注的训练集。
  • 仅选择并包含残差表明与概率样本分布一致的观测值。
  • 对结合了概率样本和选定非概率观测值的扩展数据集应用最小二乘回归。
  • 使用重缩放的自助法程序估计改进回归估计的标准误和置信区间。
  • 通过适当的残差定义,将该方法扩展至稳健估计器和正则化估计器,以及广义线性模型和加性模型。

实验结果

研究问题

  • RQ1当拥有概率样本时,能否可靠地将非概率样本数据整合进回归模型?
  • RQ2如何利用回归残差识别非概率样本中代表目标总体的观测值?
  • RQ3整合来自相似总体(如邻近国家)的数据对回归估计精度和标准误降低有何影响?
  • RQ4在结合概率样本和非概率样本时,如何可靠地估计标准误?
  • RQ5该方法能否推广至收缩估计器及广义线性模型等扩展模型?

主要发现

  • 将巴伐利亚州以外的邻近国家(如巴登-符腾堡州和黑森州)的数据纳入后,巴伐利亚数据集中回归系数的标准误降低,尤其在仅增加一个邻近国家时改善最为显著。
  • 对于巴伐利亚州,年龄和性别系数的标准误从仅使用巴伐利亚数据时的0.005和0.193,降低至加入巴登-符腾堡州数据后的0.004和0.166。
  • 当柏林为目标总体时,性别和年龄系数的标准误从0.452和0.011降低至0.429和0.010,加入勃兰登堡州数据后。
  • 在加入邻近国家数据后,稳健化估计表现出更高的稳定性,参数估计在不同模型设定下保持一致。
  • 即使在概率样本中排除异常值后,该方法仍保持一致的系数估计,表明对数据质量变化具有鲁棒性。
  • 基于自助法的标准误估计提供了可靠的推断,模拟和实证设置中方差估计的偏差极小。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。