Skip to main content
QUICK REVIEW

[论文解读] Spatial Clustering Regression of Count Value Data via Bayesian Mixture of Finite Mixtures

Peng Zhao, Hou‐Cheng Yang|arXiv (Cornell University)|Feb 16, 2020
Bayesian Methods and Mixture Models参考文献 36被引用 8
一句话总结

本文提出了一种具有马尔可夫随机场先验的贝叶斯有限高斯混合模型,用于检测计数数据的时空聚类回归系数,实现对聚类数量和空间邻接性的正则化估计。该方法在拟合乔治亚州早逝数据方面优于现有模型,识别出四个有意义的聚类,预测性能更优(LPML = -2221.45)。

ABSTRACT

Investigating relationships between response variables and covariates in areas such as environmental science, geoscience, and public health is an important endeavor. Based on a Bayesian mixture of finite mixtures model, we present a novel spatially clustered coefficients regression model for count value data. The proposed method detects the spatial homogeneity of the Poisson regression coefficients. A Markov random field constrained mixture of finite mixtures prior provides a regularized estimator of the number of clusters of regression coefficients with geographical neighborhood information. As a by-product, we also provide the theoretical properties of our proposed method when the Markov random field is exchangeable. An efficient Markov chain Monte Carlo algorithm is developed by using the multivariate log gamma distribution as a base distribution. Simulation studies are carried out to examine the empirical performance of the proposed method. Additionally, we analyze Georgia's premature death data as an illustration of the effectiveness of our approach. The supplementary materials are provided on GitHub at \url{https://github.com/pengzhaostat/MLG_MFM}.

研究动机与目标

  • 解决环境与公共卫生应用中计数数据泊松回归系数的空间异质性问题。
  • 开发一种可自动估计聚类数量的空间聚类回归系数检测方法。
  • 通过马尔可夫随机场先验引入地理邻近信息,以强制实施空间邻接约束。
  • 提供一种正则化贝叶斯框架,通过将系数估计收缩至聚类特定均值来避免过拟合。
  • 相比标准空间回归与聚类模型,提升模型可解释性与预测准确性。

提出的方法

  • 提出一种基于多元对数伽马基分布的贝叶斯有限混合模型,用于计数数据回归。
  • 在混合成分指标上引入马尔可夫随机场(MRF)先验,以强制实施聚类分配中的空间邻接性。
  • 采用具有类似狄利克雷过程先验的有限混合模型,以实现聚类数量的自动估计。
  • 基于吉布斯抽样设计高效的MCMC算法,全条件后验分布由似然与先验结构推导得出。
  • 对边际似然(LPML)使用拉普拉斯近似,用于模型比较与平滑参数选择。
  • 通过网格搜索调优MRF平滑参数,以最大化LPML,确保最优聚类配置。

实验结果

研究问题

  • RQ1贝叶斯有限混合模型能否在自动估计聚类数量的同时检测计数数据中的空间聚类回归系数?
  • RQ2引入马尔可夫随机场先验如何改善系数聚类中的空间邻接性与模型可解释性?
  • RQ3所提出的方法在计数数据的预测性能方面是否优于标准模型(如MFM、CAR、SVC)?
  • RQ4在真实世界公共卫生数据中,不同空间上分离的聚类中估计的回归系数如何变化?
  • RQ5空间邻接性约束对检测全局非连通聚类中的回归系数检测有何影响?

主要发现

  • 所提出的MRF-MFM模型取得最佳预测性能,LPML为-2221.45,显著优于普通MFM(LPML = -3614.38)、LGP(-2461.31)、CAR(-5015.93)和SVC(-3123.47)。
  • 该模型在乔治亚州159个县中识别出四个显著不同的聚类,其中150个县属于最大聚类,其余三个小聚类分别包含3、5和1个县。
  • 考伯县表现出PM2.5与早逝之间最强的正相关关系(β₁ = 1.446),表明其局部影响显著。
  • 在第4聚类中,食物环境指数显示出强烈的负向效应(β₂ = -2.093),表明更健康的饮食环境与更低的早逝率相关。
  • 第1聚类具有最高的基线风险(截距β₀ = -1.134),而第2聚类最低(β₀ = -3.644),表明基线死亡率存在区域差异。
  • 通过最大化LPML将平滑参数调优至0.3,实现了模型拟合与聚类规则性的良好平衡。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。