Skip to main content
QUICK REVIEW

[論文レビュー] Gene set bagging for estimating replicability of gene set analyses

Andrew E. Jaffe, John D. Storey|arXiv (Cornell University)|Jan 16, 2013
Gene expression and cancer classification参考文献 25被引用数 8
ひとこと要約

本論文では、遺伝子セットの豊富度解析の再現性を推定するリサンプリングベースの手法、遺伝子セットバッグィングを紹介する。高スループットデータ(例:遺伝子発現およびDNAメチル化)を繰り返しリサンプリングし、各ブートストラップ標本で有意性検定と遺伝子セット解析を実施し、再現確率(R)を計算することで、生物学的に安定で再現可能な遺伝子セットを同定する。その結果、多くの統計的に有意な遺伝子セットがリサンプリングの間で実際には不安定であることが明らかになった。

ABSTRACT

Background: Significance analysis plays a major role in identifying and ranking genes, transcription factor binding sites, DNA methylation regions, and other high-throughput features for association with disease. We propose a new approach, called gene set bagging, for measuring the stability of ranking procedures using predefined gene sets. Gene set bagging involves resampling the original high-throughput data, performing gene-set analysis on the resampled data, and confirming that biological categories replicate. This procedure can be thought of as bootstrapping gene-set analysis and can be used to determine which are the most reproducible gene sets. Results: Here we apply this approach to two common genomics applications: gene expression and DNA methylation. Even with state-of-the-art statistical ranking procedures, significant categories in a gene set enrichment analysis may be unstable when subjected to resampling. Conclusions: We demonstrate that gene lists are not necessarily stable, and therefore additional steps like gene set bagging can improve biological inference of gene set analysis.

研究の動機と目的

  • 高スループットゲノム研究における遺伝子セット豊富度解析の不安定性に対処し、繰り返し実験で再現されない有意な生物学的カテゴリーが存在することを明らかにすること。
  • 将来の研究で遺伝子セットが豊富化する確率を定量化する手法を開発し、生物学的推論のためのp値よりも情報量の多い指標を提供すること。
  • 標準的な豊富度手法を用いて、遺伝子発現およびDNAメチル化を含むさまざまなゲノムプラットフォームにおける遺伝子セットの安定性を評価すること。
  • リサンプリング下での2つの一般的な豊富度統計量(超幾何検定およびウィルコクソン順位和検定)の再現性に関する性能を比較すること。
  • 遺伝子セット解析から導かれる生物学的結論の再現性を評価するための一般化可能でプラットフォームに依存しないアプローチを提供すること。

提案手法

  • 元の高スループットデータセットを復元抽出でリサンプリングし、ブートストラップ標本を生成し、元のデータ構造を保持する。
  • 各ブートストラップ標本に対して遺伝子レベルの有意性検定(例:t検定またはランクベースの検定)を実施し、発現が変化した遺伝子を同定する。
  • 各ブートストラップ標本に対して遺伝子セット豊富度解析(例:超幾何検定またはウィルコクソン検定)を実施し、事前に定義された遺伝子セットのうち有意に豊富化しているものを特定する。
  • 各遺伝子セットの再現確率(R)を、有意と判定されたブートストラップ標本の割合として計算する。
  • 再現確率(R)を、新しい独立した研究で遺伝子セットが有意になる可能性の直接推定値として用いる。
  • Rと従来のp値の関係を比較し、Rがp値単独よりも真の再現性をよりよく予測するかどうかを評価する。

実験結果

リサーチクエスチョン

  • RQ1同じデータセットを繰り返しリサンプリングした場合、遺伝子セット豊富度解析の結果はどの程度安定しているか?
  • RQ2p値に基づいて従来から有意とされた遺伝子セットは、リサンプリングを経てどの程度再現されないか?
  • RQ3リサンプリング下で、超幾何検定とウィルコクソン順位和検定のどちらの遺伝子セット豊富度手法がより安定した結果をもたらすか?
  • RQ4再現確率(R)は、生物学的に関連性の高い遺伝子セットを優先するためのp値よりも情報量の多い指標として機能できるか?
  • RQ5遺伝子発現とDNAメチル化の例を含む、異なるオミクスデータタイプの信号対ノイズ構造は、遺伝子セットの再現性にどのように影響するか?

主な発見

  • 標準的なp値を用いて有意とされた多くの遺伝子セットは、再現確率(R < 0.5)が低く、リサンプリングの間で不安定であることが示された。
  • 遺伝子セット豊富度解析にウィルコクソン順位和検定を用いることで、超幾何検定よりもより安定した結果が得られ、Rとp値の関係もより明確かつ精密であった。
  • Rが高く(例:R > 0.5)かつp値が低い遺伝子セットは、最も安定した一貫性のある生物学的経路を示しており、将来的な研究で再現される可能性が最も高いとされた。
  • p値では有意でない遺伝子セットですら、高い再現確率を示すことがあり、p値単独では生物学的再現性を信頼できるものとは限らないことが示された。
  • 再現確率(R)は、p値よりも再発研究における再現性をより正確に予測する指標であり、生物学的検証における補完的指標としての利用価値が裏付けられた。
  • 本手法は一般化可能であり、GitHubで公開されているRパッケージ「GeneSetBagging」に実装されており、ゲノムプラットフォームや解析パイプラインを問わず広く応用可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。