[論文レビュー] Annotation Enrichment Analysis: An Alternative Method for Evaluating the Functional Properties of Gene Sets
本稿では、Gene Ontology などのデータベースにおける遺伝子アノテーション分布の非一様性を考慮することで、従来の機能的エンリッチメント解析におけるバイアスを是正する新規手法 Annotation Enrichment Analysis (AEA) を提案する。Fisherの正確確率検定 (FET) とは異なり、遺伝子セットに顕著にアノテートされた遺伝子が多い場合に有意性を過大評価するが、AEA は遺伝子の重複ではなく機能的アノテーションの重複を評価するため、従来 FET によって誤って遮蔽されていた生物学的に意味のあるエンリッチメントを明らかにする。
Gene annotation databases (compendiums maintained by the scientific community that describe the biological functions performed by individual genes) are commonly used to evaluate the functional properties of experimentally derived gene sets. Overlap statistics, such as Fisher's Exact Test (FET), are often employed to assess these associations, but don't account for non-uniformity in the number of genes annotated to individual functions or the number of functions associated with individual genes. We find FET is strongly biased toward over-estimating overlap significance if a gene set has an unusually high number of annotations. To correct for these biases, we develop Annotation Enrichment Analysis (AEA), which properly accounts for the non-uniformity of annotations. We show that AEA is able to identify biologically meaningful functional enrichments that are obscured by numerous false-positive enrichment scores in FET, and we therefore suggest it be used to more accurately assess the biological properties of gene sets.
研究の動機と目的
- 遺伝子データベースにおけるアノテーション分布の非一様性が引き起こす従来の機能的エンリッチメント解析のバイアスを特定・是正すること。
- 遺伝子セットに通常以上にアノテートされた遺伝子が含まれる場合、Fisherの正確確率検定 (FET) が有意性を過大評価する問題に対処すること。
- 遺伝子の重複ではなく機能的アノテーションの重複に基づいてエンリッチメントを評価する手法を開発し、偽陽性結果の低減を図ること。
- AEA が、FET の統計的バイアスによって遮蔽されていた生物学的に意味のある機能的エンリッチメントを同定できることを示すこと。
- Gene Ontology の DAG 構造の特性を反映させた、実用的で解析的に近似可能な FET の代替手法を提供すること。
提案手法
- 遺伝子セットと GO ブランチ内の機能的用語のセットの間の重複を計算する Annotation Enrichment Analysis (AEA) を提案し、遺伝子と用語の間の重複ではなく、機能的アノテーションの重複を評価する。
- GO ブランチを親用語とそのすべての子孫用語として定義し、ブランチにアノテートされた一意な遺伝子数を親用語にアノテートされた遺伝子数と等しくする。
- 固定された総アノテーション数 (Mg) だが、平均遺伝子アノテーション度数 (k_avg) が異なるように、ターゲットのアノテーションレベルに一致するように反復的に遺伝子を入れ替えることで、バイアスのかかったランダム遺伝子セットを構築する。
- ターゲット k_t (1% 以内) に近づくように、シャッフルされた順序でランダムに選択された用語からなるランダムな GO ブランチを生成する。
- アノテーションの重複に基づいて p 値を計算する AEA を用い、計算コストを低減するため理論的近似を適用する。
- バイアスと統計的パワーの評価を目的として、ランダムおよび実際の遺伝子シグネチャに対して AEA の結果を FET および FDR 校正済み FET と比較する。
実験結果
リサーチクエスチョン
- RQ1遺伝子セット内の遺伝子1つあたりのアノテーション数が、Fisherの正確確率検定 (FET) を用いた機能的エンリッチメント解析の有意性にバイアスを及えるか?
- RQ2Gene Ontology におけるアノテーションの非一様性が、標準的な機能的解析ツールで偽陽性のエンリッチメント信号を引き起こす可能性があるか?
- RQ3遺伝子の重複ではなく機能的アノテーションの重複を評価することで、バイアスが低減され、真の生物学的関連性の検出が向上するか?
- RQ4AEA の理論的近似は、パーミュテーションベースの AEA に代わる計算効率の高い代替手段となり得るか?
- RQ5実験的に得られた遺伝子シグネチャは、顕著にアノテートされた遺伝子を系統的に多く含んでおり、これがその機能的エンリッチメントスコアに影響を与えているか?
主な発見
- Fisherの正確確率検定 (FET) は、遺伝子セットに通常以上にアノテートされた遺伝子が含まれる場合、有意性を著しく過大評価する。
- 平均アノテーション度数 (k_avg ≈ 65) が著しく高いランダム遺伝子セットは、k_avg ≈ 21 のセットと比較して、同じ遺伝子数でも有意に多くの偽陽性エンリッチメントを示した。
- Annotation Enrichment Analysis (AEA) は、遺伝子の重複ではなくアノテーションの重複をモデル化することで、このバイアスを効果的に是正し、従来 FET によって遮蔽されていた生物学的に意味のあるエンリッチメントを明らかにした。
- Gene Signatures Database (GeneSigDB2012) に登録された実際の遺伝子シグネチャには、顕著にアノテートされた遺伝子が過剰に含まれており、これが FET の p 値を上昇させている。
- AEA は、FET がアノテーションバイアスに敏感であるため検出されない、実際の遺伝子セットにおいて有意な機能的エンリッチメントを同定している。
- 計算コストを低減しつつ精度を維持できる AEA の解析的近似が提供されており、大規模な機能的エンリッチメント解析に適している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。