Skip to main content
QUICK REVIEW

[论文解读] A reproducible effect size is more useful than an irreproducible hypothesis test to analyze high throughput sequencing datasets

Andrew D. Fernandes, Michael Vu|arXiv (Cornell University)|Sep 7, 2018
Metabolomics and Mass Spectrometry Studies被引用 4
一句话总结

本文提出了一种非参数化、标准化的中位数效应大小统计量 $ackslash{}\mathcal extasciitilde{}E extasciitilde{}_{d}$,适用于高通量测序数据,其可重复性优于p值,尤其是在小样本研究中。该方法在仅五个样本的情况下仍能一致地识别出真正差异丰度的特征,为p值和倍数变化阈值提供了一种稳健的替代方案。

ABSTRACT

Motivation: P values derived from the null hypothesis significance testing framework are strongly affected by sample size, and are known to be irreproducible in underpowered studies, yet no suitable replacement has been proposed. Results: Here we present implementations of non-parametric standardized median effect size estimates, dNEF, for high-throughput sequencing datasets. Case studies are shown for transcriptome and tag-sequencing datasets. The dNEF measure is shown to be more reproducible and robust than P values and requires sample sizes as small as 3 to reproducibly identify differentially abundant features. Availability: Source code and binaries freely available at: https://bioconductor.org/packages/ALDEx2.html , omicplotR, and https://github.com/ggloor/CoDaSeq .

研究动机与目标

  • 为解决在统计功效不足的高通量测序(HTS)研究中p值的不可重复性问题,特别是小样本情况下的问题。
  • 开发一种标准化的非参数化效应大小度量,其能比p值或倍数变化阈值更好地反映生物上有意义的差异。
  • 提供一种对零假设显著性检验(NHST)的稳健替代方案,以回答生物学上相关的问题:‘什么是可重复不同的?’
  • 评估 $\mathcal{E}_{d}$ 在可重复性、假发现率(FDR)和敏感性方面的表现,涵盖多种HTS数据集,包括转录组和16S rRNA测序数据。

提出的方法

  • 将 $\mathcal{E}_{d}$ 统计量计算为组间标准化中位数差异,通过中位绝对偏差(MMAD)进行缩放,以考虑离散程度。
  • 使用狄利克雷分布的蒙特卡洛抽样来建模技术变异,并将原始计数数据转换为概率表示,以保留组成关系。
  • 该方法利用组成数据分析原理,确保仅考虑相对丰度及其差异,避免因绝对计数而产生错误结论。
  • $\mathcal{E}_{d}$ 度量已集成至 ALDEx2、CoDaSeq 和 omicplotR R 包中,以支持可重复分析和交互式可视化。
  • 该方法采用非参数框架,不假设正态性或特定分布形式,因此适用于过度分散的HTS计数数据。
  • 该方法结合效应大小估计与离散度建模,以区分既存在差异又可重复的特征,过滤掉高方差、低可靠性信号。

实验结果

研究问题

  • RQ1非参数化、标准化的效应大小度量 $\mathcal{E}_{d}$ 是否能在小样本HTS研究中优于p值,更有效地识别出差异丰度特征?
  • RQ2当样本量低至五个时,$\mathcal{E}_{d}$ 在可重复性和假发现率方面的表现如何?
  • RQ3$\mathcal{E}_{d}$ 与生物相关性之间的相关性在多大程度上优于p值和倍数变化阈值?
  • RQ4将2倍变化阈值与 $\mathcal{E}_{d}$ 结合使用,如何减少假阳性并提高可重复性?
  • RQ5$\mathcal{E}_{d}$ 在不同类型HTS数据(如转录组和16S rRNA基因测序数据)中是否保持一致的性能?

主要发现

  • $\mathcal{E}_{d}$ 统计量比p值更具可重复性,在样本数少至五个时仍能一致识别出相同的真正阳性特征。
  • 当样本量为两个时,$\mathcal{E}_{d} > 1$ 的假发现率(FDR)达到40%,但当样本量达到15个或以上时,FDR降至10%以下。
  • 将2倍变化阈值与 $\mathcal{E}_{d}$ 结合使用,可显著降低FDR,并过滤掉高离散度、难以重现的特征。
  • 具有大绝对差异但q值接近临界值的特征通常具有高度可变性(高离散度),而 $\mathcal{E}_{d}$ 能有效排除这些特征,从而提高可靠性。
  • $\mathcal{E}_{d}$ 统计量与p值之间表现出近乎单调的关系,但其作为可重复性预测指标的可靠性远高于仅使用p值。
  • 该度量在多种数据集中表现稳健,包括转录组和16S rRNA基因测序数据,即使在高每特征离散度条件下也保持一致的行为。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。