Skip to main content
QUICK REVIEW

[论文解读] Nonparametric Bayes modeling with sample survey weights

Tsuyoshi Kunihama, Amy H. Herring|arXiv (Cornell University)|Sep 20, 2014
Bayesian Methods and Mixture Models参考文献 8被引用 6
一句话总结

本文提出了一种简单的贝叶斯非参数方法,通过使用调查纳入概率调整混合成分权重,将调查权重整合到狄利克雷过程混合模型中,同时考虑调整过程中的不确定性。该方法通过校正选择偏差,在分层调查数据中提高了估计精度,无需对未抽样单位进行复杂建模,在模拟和青少年性行为数据的真实应用中优于现有方法。

ABSTRACT

In population studies, it is standard to sample data via designs in which the population is divided into strata, with the different strata assigned different probabilities of inclusion. Although there have been some proposals for including sample survey weights into Bayesian analyses, existing methods require complex models or ignore the stratified design underlying the survey weights. We propose a simple approach based on modeling the distribution of the selected sample as a mixture, with the mixture weights appropriately adjusted, while accounting for uncertainty in the adjustment. We focus for simplicity on Dirichlet process mixtures but the proposed approach can be applied more broadly. We sketch a simple Markov chain Monte Carlo algorithm for computation, and assess the approach via simulations and an application.

研究动机与目标

  • 解决在调查设计涉及不等纳入概率的分层抽样时,将样本调查权重整合到贝叶斯非参数模型中的挑战。
  • 开发一种方法,利用调查权重调整混合模型权重,同时保持狄利克雷过程混合等非参数贝叶斯模型的灵活性。
  • 在完全贝叶斯框架内考虑权重调整过程中的不确定性,避免依赖频率学派的校正方法。
  • 提供一种计算简便的替代方案,以替代现有需要对总体中未抽样单位建模的复杂模型。
  • 展示该方法在真实调查数据中校正偏差的有效性,特别是针对偏斜或离散结果分布(如性伴侣人数)的情况。

提出的方法

  • 该方法将观测样本建模为成分的混合,其中混合权重通过调查权重调整为 $ \tilde{w}_i = w_i / \sum_{j \in S} w_j $,其中 $ w_i = c / \pi_i $,且 $ \pi_i $ 为个体 $ i $ 的纳入概率。
  • 通过将这些调整后的权重纳入后验计算,将标准狄利克雷过程混合模型扩展为包含权重调整的模型,并将权重调整视为具有不确定性的随机量。
  • 提出一种简单的MCMC算法,通过在标准混合Gibbs抽样中增加一步以使用调查权重更新混合权重,同时保持计算效率。
  • 该方法使用四舍五入核方法处理离散或混合数据类型(如具有过多零值的计数数据),通过对潜连续变量进行对数变换进行建模。
  • 该方法假设总体被划分为互不重叠的层,每层具有不同的子总体密度 $ f_m $,并将总体密度建模为成分密度的加权和。
  • 通过渐近近似提供了理论依据,表明在正则条件下,调整后的混合密度 $ \sum_{i \in S} \tilde{w}_i f(y \mid \theta_{s_i}) $ 一致地估计真实总体密度 $ f_0(y) $。

实验结果

研究问题

  • RQ1如何在不需对未抽样单位进行复杂建模的情况下,有效将分层抽样设计的调查权重整合到贝叶斯非参数模型中?
  • RQ2对混合模型权重进行简单调整是否能提高存在选择偏差的调查数据中的估计精度?
  • RQ3在不同层和样本量下,该方法在偏差、覆盖概率和稳健性方面相对于现有方法的表现如何?
  • RQ4权重调整中的不确定性对非参数贝叶斯模型后验推断有何影响?
  • RQ5该方法能否在真实世界调查应用中准确恢复复杂总体分布(如具有过多零值的高偏斜计数数据)?

主要发现

  • 在泊松混合数据的模拟中,所提方法成功捕捉到了15处的众数,而竞争方法未能做到,表明其在建模多峰和偏斜分布方面表现更优。
  • 在离散计数数据的模拟中,该方法在0到100的支撑范围内,95%可信区间对真实值的覆盖率达到98%。
  • 当层的数量增加到100且层内样本量较小时,所提方法仍优于竞争方法,即使层内代表性降低,仍能保持准确估计。
  • 在对青少年健康纵向研究的应用中,该方法揭示了性伴侣总数分布随时间的变化:1994–1995年至2001–2002年期间,零伴侣人数减少,一人伴侣人数增加,2007–2008年则出现更重的尾部。
  • 后验样本显示出稳定的收敛路径和较低的自相关性,表明MCMC混合良好且推断有效。
  • 该方法通过使用对数变换的切点和四舍五入核方法,有效处理了右偏计数数据,使在过多零值和重尾情况下的非参数密度估计更加准确。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。