Skip to main content
QUICK REVIEW

[论文解读] Bayesian Logistic Regression for Small Areas with Numerous Households

Balgobin Nandram, Lu Chen|arXiv (Cornell University)|Jun 1, 2018
Statistical Methods and Bayesian Inference参考文献 22被引用 6
一句话总结

本文提出了一种可扩展的贝叶斯逻辑回归方法,用于利用来自大量家庭的大数据进行小区域估计。通过结合集成嵌套正态近似(INNA)以实现快速超参数推断,以及并行化的精确条件后验抽样以处理随机效应,该方法在避免过度收缩的同时减轻了计算负担,从而实现了对尼泊尔生活水平调查等调查中家庭层面健康比例的高效且准确的估计。

ABSTRACT

We analyze binary data, available for a relatively large number (big data) of families (or households), which are within small areas, from a population-based survey. Inference is required for the finite population proportion of individuals with a specific character for each area. To accommodate the binary data and important features of all sampled individuals, we use a hierarchical Bayesian logistic regression model with each family (not area) having its own random effect. This modeling helps to correct for overshrinkage so common in small area estimation. Because there are numerous families, the computational time on the joint posterior density using standard Markov chain Monte Carlo (MCMC) methods is prohibitive. Therefore, the joint posterior density of the hyper-parameters is approximated using an integrated nested normal approximation (INNA) via the multiplication rule. This approach provides a sampling-based method that permits fast computation, thereby avoiding very time-consuming MCMC methods. Then, the random effects are obtained from the exact conditional posterior density using parallel computing. The unknown nonsample features and household sizes are obtained using a nested Bayesian bootstrap that can be done using parallel computing as well. For relatively small data sets (e.g., 5000 families), we compare our method with a MCMC method to show that our approach is reasonable. We discuss an example on health severity using the Nepal Living Standards Survey (NLSS).

研究动机与目标

  • 解决在具有大量家庭和二值结果的调查数据中估计小区域比例的挑战。
  • 克服在具有大量随机效应的分层贝叶斯逻辑回归模型中,标准MCMC方法计算不可行的问题。
  • 通过为每个家庭建模独立的随机效应,减少小区域估计中的过度收缩。
  • 开发一种快速的基于抽样的推断方法,在避免耗时的MCMC抽样同时保持准确性。
  • 通过嵌套贝叶斯自助法与并行计算,实现对抽样和非抽样家庭特征的估计。

提出的方法

  • 使用具有个体家庭层面随机效应的分层贝叶斯逻辑回归模型,以捕捉家庭内和家庭间的变异。
  • 通过概率的乘法法则,利用集成嵌套正态近似(INNA)近似超参数的联合后验密度。
  • 应用基于抽样的INNA方法,避免完整的MCMC抽样,显著减少计算时间。
  • 通过并行计算计算随机效应的精确条件后验分布,以保持估计的准确性。
  • 使用并行化的嵌套贝叶斯自助法估计非抽样家庭特征和规模。
  • 引入经验逻辑变换(ELT)调整,以在样本比例极端(如1或0)时稳定后验众数估计。

实验结果

研究问题

  • RQ1如何高效地将贝叶斯逻辑回归应用于具有大量家庭的小区域调查大数据?
  • RQ2集成嵌套正态近似(INNA)能否为分层逻辑模型中的超参数推断提供一种计算上可行的MCMC替代方法?
  • RQ3与区域层面的随机效应相比,为每个家庭分配独立的随机效应在小区域估计中如何减少过度收缩?
  • RQ4与完整MCMC相比,所提出的方法在估计家庭层面比例时在准确性和精确性方面保持到何种程度?
  • RQ5能否有效利用并行计算来加速大规模调查数据中随机效应和非抽样家庭特征的估计?

主要发现

  • 所提出的基于INNA的方法为具有大量家庭的分层贝叶斯逻辑回归中的超参数推断提供了一种计算高效的替代方案。
  • 通过为每个家庭分配独立的随机效应,该方法成功避免了过度收缩,提高了小区域估计的准确性。
  • 在相对较小的数据集(例如5,000户家庭)中,该方法产生的估计值和标准误与完整MCMC方法相当,验证了其合理性。
  • 并行计算使得随机效应的精确条件后验分布和非抽样特征的嵌套贝叶斯自助法能够快速计算,使该方法具备可扩展性。
  • 使用经验逻辑变换(ELT)调整可防止在样本比例为1或0时后验众数估计出现数值不稳定性。
  • 该方法在利用尼泊尔生活水平调查(NLSS)的真实数据估计家庭层面健康比例方面被证明是有效的。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。