[论文解读] A Bayesian Zero-Inflated Negative Binomial Regression Model for the Integrative Analysis of Microbiome Data
本文提出了一种新颖的贝叶斯零膨胀负二项回归(ZINB)模型,可联合识别多个组别中差异丰度的微生物分类群,并量化其与代谢物、宿主因素等协变量的关联。通过在分层混合模型中整合过度离势、零膨胀和协变量效应,并采用spline-and-slab先验,该方法在微生态整合研究中提升了检测效能和生物学可解释性,如在真实数据集中揭示了双歧杆菌与改善免疫治疗结局的关联。
Microbiome `omics approaches can reveal intriguing relationships between the human microbiome and certain disease states. Along with the identification of specific bacteria taxa associated with diseases, recent scientific advancements provide mounting evidence that metabolism, genetics and environmental factors can all modulate these microbial effects. However, the current methods for integrating microbiome data and other covariates are severely lacking. Hence, we present an integrative Bayesian zero-inflated negative binomial regression model that can both distinguish differentially abundant taxa with distinct phenotypes and quantify covariate-taxa effects. Our model demonstrates good performance using simulated data. Furthermore, we successfully integrated microbiome taxonomies and metabolomics in two real microbiome datasets to provide biologically interpretable findings. In all, we proposed a novel integrative Bayesian regression model that features bacterial differential abundance analysis and microbiome-covariate effects quantifications, which makes it suitable for general microbiome studies.
研究动机与目标
- 为解决缺乏能够同时识别差异丰度分类群并量化微生物组-协变量关联的统计方法的问题。
- 利用零膨胀负二项框架对微生态计数数据中常见的过度离势和零值过多现象进行建模。
- 将多种协变量(如代谢物、抗生素、宿主遗传)整合进统一的回归模型中,以实现整合性分析。
- 通过使用spline-and-slab先验的贝叶斯特征选择,提升统计效能并降低假发现率。
- 在复杂疾病(如黑色素瘤和炎症性肠病)中,实现对宿主-微生物组相互作用的生物学可解释性、系统级洞察。
提出的方法
- 该模型采用分层混合模型,结合零点质量分布与负二项分布,以解释微生态计数数据中的零值过多和过度离势现象。
- 采用对数线性回归结构对ZINB分布的均值进行建模,通过偏移项纳入组效应、协变量效应和测序深度。
- 对特征(分类群)应用spline-and-slab先验,实现贝叶斯特征选择,从而识别出差异丰度分类群及显著的协变量-分类群关联。
- 通过基于Gibbs采样的MCMC算法进行后验推断,以估计模型参数并计算每个特征的后验概率。
- 计算贝叶斯错误发现率(FDR)以控制高维微生态数据中的多重检验问题。
- 通过允许组特异性参数并保持一致的归一化和推断流程,将模型扩展至处理多个表型组。
实验结果
研究问题
- RQ1是否能够通过统一的统计模型,同时检测多个表型组中差异丰度的微生物分类群,并量化其与宿主协变量(如代谢物和遗传)的关联?
- RQ2与标准泊松或负二项模型相比,纳入零膨胀和过度离势是否能提升微生态计数数据中差异丰度检测的准确性?
- RQ3使用spline-and-slab先验的贝叶斯特征选择在整合微生态分析中,能在多大程度上提升统计效能并降低假发现率?
- RQ4该模型是否能从真实世界微生态数据集中揭示特定分类群与临床或分子协变量之间的生物学意义关联?
- RQ5当整合代谢组数据时,该模型在检测已知生物学关系(如双歧杆菌在黑色素瘤免疫治疗反应中的作用)方面是否具有鲁棒性?
主要发现
- 该模型在转移性黑色素瘤队列中成功识别出双歧杆菌为响应者富集分类群,其与致癌代谢物(如2-氧代精氨酸和2-羟基棕榈酸)呈强烈负相关,与既往生物学发现一致。
- 在模拟数据中,该模型在检测差异丰度分类群及协变量-分类群关联方面表现优于现有方法,尤其在高零膨胀和过度离势条件下。
- 贝叶斯后验概率与FDR控制使得在不施加系统发育约束的条件下,可靠识别出具有生物学意义的特征,且结果在相同系统发育分支内聚类。
- 该方法实现了快速后验推断,使用高效的MCMC算法,两份真实MSS数据集的分析在数分钟内完成。
- 该模型揭示了微生物分类群与代谢物之间的新关联,如与致癌信号通路相关的脂肪酸代谢物受到抑制,提示了免疫治疗反应的潜在机制。
- 该框架可扩展至多个表型组,并可适配用于建模微生物组对宿主组学(如染色质可及性和基因调控)的影响,从而实现双向系统生物学分析。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。