[论文解读] Variable subset selection via GA and information complexity in mixtures of Poisson and negative binomial regression models
本文提出了一种基于遗传算法(GA)和信息复杂性准则(AIC、BIC、CAIC、ICOMP)的有限混合泊松与负二项回归模型,结合变量子集选择方法,以识别过度分散计数数据中的同质子群体。该方法在田纳西州HIV县数据中成功识别出四个不同的子群体,其中城市状态和非西班牙裔白人人口比例为关键预测变量,揭示了疾病负担的空间异质性。
Count data, for example the number of observed cases of a disease in a city, often arise in the fields of healthcare analytics and epidemiology. In this paper, we consider performing regression on multivariate data in which our outcome is a count. Specifically, we derive log-likelihood functions for finite mixtures of regression models involving counts that come from a Poisson distribution, as well as a negative binomial distribution when the counts are significantly overdispersed. Within our proposed modeling framework, we carry out optimal component selection using the information criteria scores AIC, BIC, CAIC, and ICOMP. We demonstrate applications of our approach on simulated data, as well as on a real data set of HIV cases in Tennessee counties from the year 2010. Finally, using a genetic algorithm within our framework, we perform variable subset selection to determine the covariates that are most responsible for categorizing Tennessee counties. This leads to some interesting insights into the traits of counties that have high HIV counts.
研究动机与目标
- 通过使用有限混合泊松与负二项回归模型对流行病学研究中常见的过度分散计数数据进行子群体建模,以解决过度分散问题。
- 系统性地利用信息准则(AIC、BIC、CAIC、ICOMP)确定有限混合模型中最佳成分数量。
- 采用遗传算法(GA)进行变量子集选择,以识别在将县划分为不同子群体时最具影响力的协变量。
- 提供一种数据驱动的模型选择方法,避免主观选择成分数量,并提升公共卫生分析中的可解释性。
提出的方法
- 为有限混合泊松与负二项(NB-2)回归模型制定对数似然函数,以处理过度分散的计数数据。
- 应用信息复杂性准则——AIC、BIC、CAIC 和 ICOMP,客观选择最优的混合成分数量。
- 采用遗传算法(GA)进行变量子集选择,从田纳西州HIV数据集中的8个预测变量中识别最具信息量的协变量。
- 在ICOMP中使用逆费雪信息矩阵(IFIM)对模型复杂度进行惩罚,以提高模型选择的准确性。
- 拟合选定变量的有限混合模型,并通过评估各成分特定的回归系数来解释子群体特征。
- 在模拟数据和包含95个田纳西州县2010年HIV病例数的真实数据集上验证该方法。
实验结果
研究问题
- RQ1基于HIV病例数,田纳西州各县的最优同质子群体数量是多少?该数量如何通过信息准则确定?
- RQ2通过变量子集选择识别出的哪些协变量最能区分子群体在HIV负担方面的差异?
- RQ3有限混合模型识别出的不同子群体中,协变量(如城市状态、种族/民族)的影响如何变化?
- RQ4人口规模在农村与城市县之间对社会经济指标与HIV发病率关系的混淆程度如何?
- RQ5与标准泊松或NB-2回归相比,所提出的框架在过度分散计数数据中是否能提升模型拟合度与可解释性?
主要发现
- 最优有限混合模型选择了四个成分,表明县存在四种具有不同HIV病例率模式的独立子群体。
- 遗传算法频繁选择变量4(城市指标)和变量7(非西班牙裔白人人口比例),表明其具有强大的预测能力。
- 包含变量1、3、4、5和7(包括城市状态和非西班牙裔白人比例)的模型在AIC(708.76)、CAIC(776.89)和SBC(756.89)上得分最低,表明拟合效果最佳。
- 在四个成分中的三个中,非西班牙裔白人人口比例显著降低HIV病例数,而城市状态则是显著的风险因素。
- 贫困率、失业率以及高中及以下教育水平的比例在各成分中逐渐下降,而城市指标和少数族裔比例则上升,表明向更城市化、更多元化的县群转移,且HIV病例数更高。
- 最高的HIV病例数与纳什维尔、孟菲斯、诺克斯维尔和查塔努加等大城市相关,证实了疾病负担在城市中的聚集性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。