Skip to main content
QUICK REVIEW

[论文解读] LinDA: linear models for differential abundance analysis of microbiome compositional data

Huijuan Zhou, Kejun He|arXiv (Cornell University)|Apr 1, 2021
Metabolomics and Mass Spectrometry Studies被引用 7
一句话总结

LinDA 提出了一种针对微生物组组成数据的差异丰度分析的线性建模方法,通过应用中心对数比(CLR)变换和偏差校正来控制假发现率(FDR)。该方法实现了渐近FDR控制,具有可扩展性,并可扩展至混合效应模型以处理相关数据,在模拟数据和真实数据集中均表现出更高的准确性和鲁棒性。

ABSTRACT

Differential abundance analysis is at the core of statistical analysis of microbiome data. The compositional nature of microbiome sequencing data makes false positive control challenging. Here, we show that the compositional effects can be addressed by a simple, yet highly flexible and scalable, approach. The proposed method, LinDA, only requires fitting linear regression models on the centered log-ratio transformed data, and correcting the bias due to compositional effects. We show that LinDA enjoys asymptotic FDR control and can be extended to mixed-effect models for correlated microbiome data. Using simulations and real examples, we demonstrate the effectiveness of LinDA.

研究动机与目标

  • 解决微生物组测序数据中组成效应的挑战,其中相对丰度会扭曲真实的差异丰度信号。
  • 开发一种即使在缺乏绝对丰度测量的情况下也能控制差异丰度分析中假发现率(FDR)的方法。
  • 提供一种可扩展、灵活且计算高效的解决方案,利用CLR变换数据上的线性模型并结合偏差校正。
  • 将该方法扩展至混合效应模型,以处理纵向或分层研究设计中的相关微生物组数据。
  • 在稀疏或密集信号的真实假设下,实现对差异丰度分类群的可靠识别,以支持后续生物学验证。

提出的方法

  • 使用中心对数比(CLR)变换对原始微生物组丰度数据进行转换,以缓解组成效应的影响。
  • 在CLR变换后的数据上拟合线性回归模型,以评估分类群与感兴趣协变量之间的关联。
  • 通过从检验统计量渐近分布推导出的理论校正项,校正CLR变换引入的偏差。
  • 对校正后的检验统计量应用假发现率(FDR)控制程序,确保在原假设下实现渐近FDR控制。
  • 通过引入随机效应,将该框架扩展至混合效应模型,以处理相关样本(如重复测量或家族结构)。
  • 在R包 MicrobiomeStat 中实现该方法,作为 `linda` 函数,支持单变量和多变量分析,并提供灵活的归一化和零值处理选项。

实验结果

研究问题

  • RQ1在CLR变换数据上采用简单的线性建模方法,是否能在组成性微生物组数据的差异丰度分析中实现渐近FDR控制?
  • RQ2在具有不同丰度分布和组成效应的多种模拟设置下,LinDA与edgeR、DESeq2、MaAsLin2和ANCOM-BC等现有方法相比表现如何?
  • RQ3当真实信号在分类群中为稀疏或密集时,LinDA在保持统计功效和FDR控制方面表现如何?
  • RQ4在LinDA中引入随机效应,是否能提升对纵向或配对设计等相关微生物组数据的性能?
  • RQ5与其它方法相比,LinDA在不同规模和复杂度的数据集上的计算可扩展性如何?

主要发现

  • LinDA在所有模拟设置中均实现了渐近FDR控制,经验FDR值始终接近名义目标值(如0.05),即使在强组成效应下也保持稳定。
  • 在对数正态分布和伽马分布丰度的模拟中,LinDA在控制FDR的同时保持了高统计功效(AUC > 0.90),在精确度和鲁棒性方面优于ANCOM-BC、MaAsLin2和edgeR。
  • 在真实数据集中表现优异:CDI(n=100)、IBD(n=120)、RA(n=100)和SMOKE(n=150),在不同FDR阈值(0.01–0.25)下均能识别出具有生物学合理性的分类群,且结果高度可重复。
  • 运行时间基准测试显示,LinDA显著快于ANCOM-BC和MaAsLin2,在包含最多1,000个分类群和200个样本的数据集上执行时间均低于10秒。
  • 在相关数据结构中引入随机效应后,LinDA在控制第一类错误方面表现更优,经验FDR在多种具有聚类或重复测量的模拟设置中均保持在0.05以内。
  • 该方法对零膨胀和极端丰度变化具有鲁棒性,在不同零值处理策略(包括反双曲正弦变换和伪计数调整)下均保持稳定性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。