[论文解读] Clustering microbiome data using mixtures of logistic normal multinomial models
本文提出一种基于模型的微生物组组成数据聚类方法,采用多项对数正态混合模型结合变分高斯近似(VGA)以实现高效参数估计。通过加性对数比(alr)变换将相对丰度转换,并利用高斯分布近似潜变量的后验分布,该方法相比MCMC显著降低了计算负担,从而在模拟数据和真实数据集(包括Ferretti口腔微生物组数据集和Shi数据集)上实现了准确聚类。
Discrete data such as counts of microbiome taxa resulting from next-generation sequencing are routinely encountered in bioinformatics. Taxa count data in microbiome studies are typically high-dimensional, over-dispersed, and can only reveal relative abundance therefore being treated as compositional. Analyzing compositional data presents many challenges because they are restricted on a simplex. In a logistic normal multinomial model, the relative abundance is mapped from a simplex to a latent variable that exists on the real Euclidean space using the additive log-ratio transformation. While a logistic normal multinomial approach brings in flexibility for modeling the data, it comes with a heavy computational cost as the parameter estimation typically relies on Bayesian techniques. In this paper, we develop a novel mixture of logistic normal multinomial models for clustering microbiome data. Additionally, we utilize an efficient framework for parameter estimation using variational Gaussian approximations (VGA). Adopting a variational Gaussian approximation for the posterior of the latent variable reduces the computational overhead substantially. The proposed method is illustrated on simulated and real datasets.
研究动机与目标
- 解决高维、过度分散且具有组成性的微生物组计数数据聚类的挑战。
- 克服在对数正态多项式模型中使用MCMC进行参数估计时的高计算成本问题。
- 开发一种可扩展的、基于模型的聚类框架,以保持微生物组数据的组成特性。
- 通过变分近似实现在高维设置下的高效估计与聚类。
- 在具有已知群组结构的真实和模拟数据集上展示该方法的性能。
提出的方法
- 使用对数正态多项式分布对相对丰度进行建模,通过加性对数比(alr)变换将单纯形约束数据映射到实欧氏空间。
- 采用有限混合的对数正态多项式模型以捕捉微生物组数据中潜在的聚类结构。
- 使用变分高斯近似(VGA)近似潜变量的后验分布,替代计算密集型的MCMC采样。
- 实施广义期望最大化(GEM)算法,通过交替估计聚类分配和利用VGA更新模型参数。
- 应用ALDEx2进行特征选择,以识别差异丰度的分类群,降低维度的同时保持组成完整性。
- 在潜空间中使用协方差矩阵的逆来建模分类群之间的依赖关系,并在高维设置下考虑正则化。
实验结果
研究问题
- RQ1混合对数正态多项式模型能否有效恢复微生物组数据中真实的潜在聚类结构?
- RQ2所提出的变分高斯近似与基于MCMC的推断相比,在计算效率和聚类准确性方面表现如何?
- RQ3特征选择(如ALDEx2或丰度最高的分类群)对低维和高维设置下聚类性能有何影响?
- RQ4该方法在具有已知生物学分组的真实世界微生物组数据集上的表现如何?
- RQ5该模型能否通过回归扩展形式纳入环境或生物学协变量?
主要发现
- 在模拟数据上,所提出方法实现了高聚类准确性,参数恢复接近真实值,表现出强鲁棒性和一致性。
- 在Ferretti口腔微生物组数据集上,使用最差异丰度的属时,调整兰德指数(ARI)达到0.85,显著优于仅使用最丰富分类群的模型。
- 在Shi数据集上,两分量模型的ARI为0.05,48个样本中有18个分类错误,表明在样本量较小的设置下表现中等。
- 在atlas1006数据集上,ARI为0.002,表明该数据集聚类信号有限或复杂度较高。
- 通过ALDEx2识别差异丰度分类群显著提升了聚类性能,优于仅使用最丰富分类群的方法,凸显了特征选择的重要性。
- 变分高斯近似框架相比MCMC显著降低了计算成本,使该方法能够扩展至高维微生物组数据。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。