Skip to main content
QUICK REVIEW

[论文解读] Unit Level Modeling of Survey Data for Small Area Estimation Under Informative Sampling: A Comprehensive Overview with Extensions

Paul A. Parker, Ryan Janicki|arXiv (Cornell University)|Aug 27, 2019
demographic modeling and climate adaptation参考文献 45被引用 9
一句话总结

本文全面回顾并扩展了在信息性抽样设计下贝叶斯个体水平模型在小区域估计中的应用,其中调查选择概率与结果相关。论文提出了三种计算高效的模型,通过引入调查权重和设计变量来降低偏差并提高精度,模拟结果显示模型3的均方误差(MSE)最低,并已直接应用于美国社区调查数据。

ABSTRACT

Model-based small area estimation is frequently used in conjunction with survey data in order to establish estimates for under-sampled or unsampled geographies. These models can be specified at either the area-level, or the unit-level, but unit-level models often offer potential advantages such as more precise estimates and easy spatial aggregation. Nevertheless, relative to area-level models, literature on unit-level models is less prevalent. In modeling small areas at the unit level, challenges often arise as a consequence of the informative sampling mechanism used to collect the survey data. This paper provides a comprehensive methodological review for unit-level models under informative sampling, with an emphasis on Bayesian approaches. To provide insight into the differences between methods, we conduct a simulation study that compares several of the described approaches. In addition, the methods used for simulation are further illustrated through an application to the American Community Survey. Finally, we present several extensions and areas for future research.

研究动机与目标

  • 填补个体水平小区域估计在信息性抽样设计下的方法论文献空白。
  • 克服区域水平模型的局限性,如空间聚合性能差以及无法在更细粒度分辨率下进行估计。
  • 开发并评估能够正确处理信息性抽样的贝叶斯个体水平模型,以减少偏差并提高估计精度。
  • 通过模拟研究和对美国社区调查的真实数据应用,证明这些模型的有效性。
  • 为未来的方法论发展提供现有模型的扩展,包括Pfeffermann和Sverchkov(2007)的贝叶斯版本以及基于样条的方法。

提出的方法

  • 以个体调查单元(如家庭或个人)作为响应变量,而非聚合的直接估计值,构建个体水平模型。
  • 在似然函数中引入调查权重或设计变量,以处理信息性抽样,确保估计无偏。
  • 采用贝叶斯分层模型并引入区域特定的随机效应,实现在小区域之间的‘借用信息’。
  • 实施三种不同的模型变体:模型1采用含设计变量的线性混合模型;模型2应用惩罚样条以实现灵活建模;模型3采用Pfeffermann和Sverchkov(2007)的贝叶斯版本并结合加权似然。
  • 在高维设置中应用伪似然和经验贝叶斯估计技术,以提高计算效率。
  • 使用马尔可夫链蒙特卡洛(MCMC)方法进行贝叶斯模型的后验推断,确保完整的不确定性量化。

实验结果

研究问题

  • RQ1在均方误差(MSE)和方差缩减方面,信息性抽样下的个体水平模型与直接设计基于估计器相比表现如何?
  • RQ2哪种模型设定——线性混合效应模型、惩罚样条或贝叶斯伪似然——在精度、计算效率和稳健性之间提供了最佳平衡?
  • RQ3个体水平模型是否能自然支持多分辨率估计(如县和学区级别),而无需人为基准调整?
  • RQ4所提出的模型如何处理零计数或低计数结果(如样本稀疏区域的贫困率)?
  • RQ5通过调查权重和设计变量的引入,对个体水平小区域估计中的偏差减少有何影响?

主要发现

  • 在模拟研究中,模型3(即Pfeffermann和Sverchkov(2007)的贝叶斯扩展)在三种基于模型的估计器中实现了最低的均方误差(MSE)。
  • 模型1计算时间最短,特别适用于高维或大规模应用场景。
  • 与直接估计器相比,个体水平模型在均方误差和标准误方面均有显著降低,如2014年明尼苏达州各县的图3所示。
  • 这些模型实现了自然的空间聚合,确保了不同地理层级(如县和州)估计值之间的逻辑一致性,无需外部基准调整。
  • 与对数尺度的SAIPE模型不同,个体水平建模无需对数变换,可直接估计零计数而不会引起模型不稳定。
  • 模拟研究和真实数据应用均证实,通过调查权重引入信息性抽样可显著减少偏差并提高小区域估计的精度。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。