[論文レビュー] Identification and quantification of Granger causality between gene sets
本稿では、正規化相関分析(CCA)とブートストラップ仮説検定を用いて、遺伝子群間のグレインジャー因果関係を同定・定量する新規手法を提案する。この手法により、生物学的経路間の情報フローの検出が可能となる。シミュレートされたおよび実際の遺伝子発現データにおいて、標準的なVARモデルに比べて優れた性能を示し、高次元の生物学的ネットワークにおける因果関係の検出に高い検出力を持つ。
Wiener and Granger have introduced an intuitive concept of causality between two variables which is based on the idea that an effect never occurs before its cause. Later, Geweke has generalized this concept to a multivariate Granger causality, i.e., n variables Granger-cause another variable. Although Granger causality is not "effective causality", this concept is useful to infer directionality and information flow in observational data. Granger causality is usually identified by using VAR models due to their simplicity. In the last few years, several VAR-based models were presented in order to model gene regulatory networks. Here, we generalize the multivariate Granger causality concept in order to identify Granger causalities between sets of gene expressions, i.e., whether a set of n genes Granger-causes another set of m genes, aiming at identifying and quantifying the flow of information between gene networks (or pathways). The concept of Granger causality for sets of variables is presented. Moreover, a method for its identification with a bootstrap test is proposed. This method is applied in simulated and also in actual biological gene expression data in order to model regulatory networks. This concept may be useful to understand the complete information flow from one network or pathway to the other, mainly in regulatory networks. Linking this concept to graph theory, sink and source can be generalized to node sets. Moreover, hub and centrality for sets of genes can be defined based on total information flow. Another application is in annotation, when the functionality of a set of genes is unknown, but this set is Granger caused by another set of genes which is well studied. Therefore, this information may be useful to infer or construct some hypothesis about the unknown set of genes.
研究の動機と目的
- 個々の遺伝子から遺伝子群へのグレインジャー因果関係の拡張を図り、生物学的経路やネットワーク間の情報フローの分析を可能にする。
- 高次元の遺伝子発現データにおける遺伝子群間の因果的影響の同定および定量的評価を可能にする統計的に頑健な手法の開発。
- 遺伝子数がサンプル数を上回る状況において、標準VARモデルが多変量因果関係を同定する際の限界を克服すること。
- よく知られた経路との因果関係に基づいて、未同定の遺伝子群の機能的役割を推定するフレームワークの提供。
提案手法
- 本手法は、2つの時系列(遺伝子群)の関係をモデル化するため、正規化相関分析(CCA)を用い、一方の遺伝子群の過去の値と他方の遺伝子群の現在の値の間の線形依存関係を捉える。
- CCAに基づくグレインジャー因果関係の統計的有意性を評価するために、ブートストラップに基づく仮説検定が用いられ、第一種の過誤率を5%に制御する。
- 本手法は、遺伝子群に属する個々の遺伝子における因果的影響を統合することで、1つの遺伝子群から別の遺伝子群への総合的情報フローを定量化する。
- 性能評価は、シミュレートされたおよび実際の遺伝子発現データを用いて、標準VARモデルとWald検定を用いた多変量グレインジャー因果関係の検定と比較して実施される。
- 本フレームワークにより、情報フローの合計量に基づいて、源、シンク、ハブ、中心性といったネットワーク概念を遺伝子群に一般化可能である。
実験結果
リサーチクエスチョン
- RQ1個々の遺伝子から遺伝子群へのグレインジャー因果関係を意味的に拡張することは可能か? これにより、生物学的経路間の情報フローをモデル化できるか?
- RQ2高次元でサンプル数が少ない遺伝子発現データにおいて、集合レベルのグレインジャー因果関係の統計的有意性を信頼性高く評価する方法は何か?
- RQ3提案されたCCAベースの手法は、標準VARモデルに比べて、遺伝子群間の多変量グレインジャー因果関係を検出する際に優れた性能を示すか?
- RQ4本手法は、よく注釈のなされた経路との因果関係に基づいて、機能が不明な遺伝子群の役割を推定できるか?
主な発見
- 10,000回の繰り返しを含むシミュレートデータにおいて、CCAベースの手法は標準VARモデルに比べて、遺伝子群間のグレインジャー因果関係を検出する際に高い統計的検出力を示した。
- ブートストラップに基づく検定手順は、複数回のシミュレーションにわたり、5%の誤り発生率(第一種の過誤)を効果的に制御し、頑健な推論を可能にした。
- 既知の因果構造(例:I → II, I → III)を有するシミュレートデータにおいて、本手法は高い感度と特異度で因果関係を正しく同定した。
- 実際の遺伝子発現データにおいて、生物学的に妥当な情報フローのパターン、特に経路間の時間遅れを伴う調節的影響を効果的に同定した。
- 本フレームワークにより、総合的情報フローに基づいて遺伝子群のネットワーク中心性を定義でき、主要な調節ハブを同定することが可能となった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。