Skip to main content
QUICK REVIEW

[论文解读] Gene set bagging for estimating replicability of gene set analyses

Andrew E. Jaffe, John D. Storey|arXiv (Cornell University)|Jan 16, 2013
Gene expression and cancer classification参考文献 25被引用 8
一句话总结

本文提出基因集自助法(gene set bagging),一种基于重抽样的方法,用于估计基因集富集分析在基因组学中的可重复性。通过反复对高通量数据(如基因表达和DNA甲基化)进行重抽样,在每个自举样本上执行显著性检验和基因集分析,并计算复制概率(R),该方法识别出生物上稳定且可重复的基因集——揭示出许多在统计上显著的基因集在重抽样中实际上并不稳定。

ABSTRACT

Background: Significance analysis plays a major role in identifying and ranking genes, transcription factor binding sites, DNA methylation regions, and other high-throughput features for association with disease. We propose a new approach, called gene set bagging, for measuring the stability of ranking procedures using predefined gene sets. Gene set bagging involves resampling the original high-throughput data, performing gene-set analysis on the resampled data, and confirming that biological categories replicate. This procedure can be thought of as bootstrapping gene-set analysis and can be used to determine which are the most reproducible gene sets. Results: Here we apply this approach to two common genomics applications: gene expression and DNA methylation. Even with state-of-the-art statistical ranking procedures, significant categories in a gene set enrichment analysis may be unstable when subjected to resampling. Conclusions: We demonstrate that gene lists are not necessarily stable, and therefore additional steps like gene set bagging can improve biological inference of gene set analysis.

研究动机与目标

  • 为解决高通量基因组学研究中基因集富集结果的不稳定性问题,即显著的生物类别在重复实验中可能无法重现。
  • 开发一种方法,量化基因集在未来研究中被富集的概率,为生物推断提供比p值更具信息量的指标。
  • 评估在标准富集方法下,不同基因组平台(包括基因表达和DNA甲基化)中基因集的稳定性。
  • 比较两种常见富集统计量——超几何检验和Wilcoxon秩和检验——在重抽样下的可重复性表现。
  • 提供一种可推广的、平台无关的方法,用于评估基于基因集分析得出的生物结论的可重复性。

提出的方法

  • 以有放回的方式对原始高通量数据集进行重抽样,生成自举样本,同时保持原始数据结构。
  • 在每个自举样本上执行基因水平的显著性检验(如t检验或基于秩次的检验),以识别差异表达基因。
  • 对每个自举样本应用基因集富集分析(如超几何检验或Wilcoxon检验),确定哪些预定义的基因集具有富集性。
  • 将每个基因集的复制概率(R)计算为在所有自举样本中该基因集被判定为显著的比例。
  • 将复制概率(R)直接用作基因集在未来独立研究中具有显著性的可能性的估计值。
  • 比较R与传统p值之间的关系,以评估R是否比p值本身更能预测真实可重复性。

实验结果

研究问题

  • RQ1在对同一数据集进行重复重抽样时,基因集富集结果的稳定性如何?
  • RQ2在重抽样下,传统上显著的基因集(基于p值)在多大程度上无法重现?
  • RQ3在重抽样下,哪种基因集富集方法——超几何检验还是Wilcoxon秩和检验——产生更稳定的结果?
  • RQ4复制概率(R)能否作为比p值更具信息量的指标,用于优先筛选具有生物相关性的基因集?
  • RQ5不同组学数据类型(如基因表达与DNA甲基化)的信号-噪声结构如何影响基因集的可重复性?

主要发现

  • 许多使用标准p值识别出的显著基因集表现出较低的复制概率(R < 0.5),表明其在重抽样中稳定性差。
  • 使用Wilcoxon秩和检验进行基因集富集分析产生的结果比超几何检验更稳定,且R与p值之间的关系更强、更精确。
  • 具有高R值(如R > 0.5)且p值较低的基因集代表最稳定、最一致的生物通路,表明其在后续研究中最具可重复性。
  • 即使某些基因集在p值上不显著,也可能表现出较高的复制概率,表明p值本身可能无法可靠反映生物可重复性。
  • 复制概率(R)是未来研究中可重复性的更准确预测指标,支持其作为生物验证中p值的补充指标使用。
  • 该方法具有可推广性,并已实现为R包‘GeneSetBagging’,可在GitHub上获取,支持在各类基因组平台和分析流程中的广泛应用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。