[論文レビュー] Testing hypotheses on a tree: new error rates and controlling strategies
本稿では、仮説の階層的木構造において、複数の解像度レベルで誤り発見率(FDR)を制御する新しい多重仮説検定手順、TreeBH を提案する。依存性の仮定と逐次的検定アルゴリズムを活用することで、従来の手法と比較して統計的パワーを向上させつつも、FDR を制御する。シミュレーションおよび GTEx とマイクロバイオームデータへの実世界の応用でその有効性が示された。
We introduce a multiple testing procedure (TreeBH) which addresses the challenge of controlling error rates at multiple levels of resolution. Conceptually, we frame this problem as the selection of hypotheses which are organized hierarchically in a tree structure. We describe a fast algorithm for the proposed sequential procedure, and prove that it controls relevant error rates given certain assumptions on the dependence among the p-values. Through simulations, we demonstrate that TreeBH offers the desired guarantees under a range of dependency structures (including one similar to that encountered in genome-wide association studies) and that it has the potential of gaining power over alternative methods. We also introduce a modified version of TreeBH which we prove to control the relevant error rates under any dependency structure. We conclude with two case studies: we first analyze data collected as part of the Genotype-Tissue Expression (GTEx) project, which aims to characterize the genetic regulation of gene expression across multiple tissues in the human body, and secondly, data examining the relationship between the gut microbiome and colorectal cancer.
研究の動機と目的
- 階層的仮説検定における複数の解像度レベルで誤り率を制御する課題に対処すること。
- すべての仮説を同等に扱う代わりに、木構造に従って構造化された仮説において FDR 制御を維持する手法を開発すること。
- 仮説の階層的構造を活用することで、細分化された仮説の無駄な検定を減らし、統計的パワーを向上させること。
- 解像度の順序で仮説を検定する逐次的データ収集に適したフレームワークを提供すること。
- 実際のゲノムデータに見られるような、p 値間にさまざまな依存構造が存在する状況でも頑健性を確保すること。
提案手法
- 木構造に沿ってトップダウンの順序で仮説を検定する逐次的多重仮説検定手順、TreeBH を提案すること。
- 各ノードにおける仮説を、その下流ノードに基づいて動的に調整された臨界値以下である場合にのみ、棄却する段階的手続きを用いること。
- 正の回帰依存性(PRDS)が木構造に成り立つ条件下で、木の各レベルで FDR を制御すること。
- 任意の依存構造にも対応できるように改良した TreeBH の変種を導入し、頑健性を高めること。
- 後行順で木を走査し、葉から根へと再帰的に臨界値を計算する高速なアルゴリズムを実装すること。
- GTEx およびマイクロバイオーム研究において、SNP(レベル1)、遺伝子(レベル2)、臓器(レベル3)を階層的ツリーにグループ化し、手順を実データに適用すること。
実験結果
リサーチクエスチョン
- RQ1木構造の仮説空間において、複数の解像度レベルで同時に FDR を制御できるか?
- RQ2階層的構造を活用することで、BH や BB のような標準的手法と比較して統計的パワーが向上するか?
- RQ3実際の依存構造、例えば多組織 eQTL スタディに見られるような構造において、TreeBH はどのように性能を発揮するか?
- RQ4強い仮定を必要とせず、p 値間に任意の依存関係がある状況でも、手順を適応可能にできるか?
- RQ5GTEx やマイクロバイオームスタディのような実世界のマルチオミクスデータセットに適用した場合、TreeBH は誤り率の制御を維持できるか?
主な発見
- TreeBH は、実際の多組織 eQTL データに類似したさまざまな依存構造の下でも、木のあらゆるレベルでターゲット FDR をほぼ正確に制御した。
- TreeBH はベンチマーク手順である BB と同等の FDR、sFDR、パワーを達成したが、信号が希な状況では誤り率の制御がさらに優れていた。
- 5つの臓器で250個の遺伝子と8,713個のSNPを含むシミュレーションにおいて、TreeBH は BH よりも FDR 制御が優れており、BH はターゲット誤り率を維持できなかった。
- 改良された TreeBH の変種は、PRDS の仮定を超えて任意の依存構造においても FDR を制御でき、手法の頑健性が拡張された。
- GTEx の事例研究では、TreeBH は誤り率を制御しながら、複数の解像度レベルで生物学的に意味のある eGene や eSNP を同定した。
- マイクロバイオームスタディでは、TreeBH が家族および属レベルでの関連性を効果的に同定し、複雑な微生物集団解析への有用性を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。