Skip to main content
QUICK REVIEW

[论文解读] Robust Differential Abundance Test in Compositional Data

Shulei Wang|arXiv (Cornell University)|Jan 21, 2021
Geochemistry and Geologic Mapping被引用 4
一句话总结

本文提出了一种名为稳健差异丰度(RDB)检验的新方法,用于对具有零计数和恒和约束的组成数据进行差异丰度分析。通过将检验形式化为基于参考的假设检验,并在重归一化比例上迭代应用Welch's t检验,RDB检验在渐近意义上控制了家庭错误率,并可在不使用伪计数插补的情况下可靠检测出差异丰度组分。

ABSTRACT

Differential abundance tests in compositional data are essential and fundamental tasks in various biomedical applications, such as single-cell, bulk RNA-seq, and microbiome data analysis. However, because of the compositional constraint and the prevalence of zero counts in the data, differential abundance analysis in compositional data remains a complicated and unsolved statistical problem. This study introduces a new differential abundance test, the robust differential abundance (RDB) test, to address these challenges. Compared with existing methods, the RDB test is simple and computationally efficient, is robust to prevalent zero counts in compositional datasets, can take the data's compositional nature into account, and has a theoretical guarantee of controlling false discoveries in a general setting. Furthermore, in the presence of observed covariates, the RDB test can work with the covariate balancing techniques to remove the potential confounding effects and draw reliable conclusions. Finally, we apply the new test to several numerical examples using simulated and real datasets to demonstrate its practical merits.

研究动机与目标

  • 解决在普遍存在零计数和组成约束的组成数据中进行差异丰度检验的长期挑战。
  • 开发一种计算高效、对零膨胀数据具有鲁棒性,并考虑组成数据恒和性质的方法。
  • 在一般设置下为家庭错误率控制提供理论保证。
  • 通过与协变量平衡技术集成,在存在混杂协变量的情况下实现可靠推断。
  • 消除对诸如伪计数等临时零计数插补策略的需求,这些策略可能增加假发现率。

提出的方法

  • 将差异丰度检验形式化为基于参考的假设检验,其中组分相对于一个未知参考集进行比较。
  • 采用迭代两阶段程序:第一阶段,聚合t统计量以确定检验方向;第二阶段,对各组分应用方向性两样本t检验。
  • 在每次迭代中对重归一化比例应用Welch's t检验,避免直接处理零计数。
  • 通过迭代地利用方向性比较来改进检验统计量,采用类似经验贝叶斯的策略。
  • 理论基础依赖于大数不等式和区间熵,以建立渐近家庭错误率控制。
  • 与协变量平衡技术集成,以调整观察性研究中混杂效应的影响。

实验结果

研究问题

  • RQ1能否开发一种对零计数具有鲁棒性的差异丰度检验,而无需依赖伪计数插补?
  • RQ2此类检验是否能在一般组成数据设置下保持对家庭错误率的理论控制?
  • RQ3该方法在恒和约束下能否有效识别出差异丰度组分?
  • RQ4在观察性数据中存在混杂协变量时,RDB检验的表现如何?
  • RQ5使用重归一化t统计量的迭代两阶段策略在计算效率和统计有效性方面是否均成立?

主要发现

  • 在一般条件下,RDB检验在渐近意义上将家庭错误率控制在水平α。
  • 当信噪比足够大时,该方法以高概率完全恢复出差异丰度组分。
  • 理论分析表明,尽管重归一化和迭代过程引入了依赖性,该方法的误差控制依然成立。
  • RDB检验避免了使用伪计数,从而降低了与此类插补相关的假阳性发现风险。
  • 在模拟和真实数据集上的实证评估表明,该方法在统计功效和鲁棒性方面具有实际优势。
  • 与协变量平衡技术的集成使得在存在混杂变量的情况下也能实现可靠推断。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。