Skip to main content
QUICK REVIEW

[論文レビュー] Hub discovery in partial correlation graphical models

Alfred O. Hero, Bala Rajaratnam|arXiv (Cornell University)|Sep 30, 2011
Bioinformatics and Genomic Networks参考文献 17被引用数 3
ひとこと要約

本稿は、サンプル数 $ n $ が変数数 $ p $ よりも著しく小さい高次元部分相関グラフィカルモデルにおいて、強く接続された変数(ハブ)を特定するスケーラブルなハブスクリーニングフレームワークを提案する。スパース共分散仮定の下でZスコア変換と漸近的ポアソン極限を活用することで、誤発見率を制御し、p値の軌跡を用いた統計的有意性を有する正確なハブの同定が可能となり、大規模な乳がん遺伝子発現データセットで検証された。

ABSTRACT

This paper treats the problem of screening a p-variate sample for strongly and multiply connected vertices in the partial correlation graph associated with the the partial correlation matrix of the sample. This problem, called hub screening, is important in many applications ranging from network security to computational biology to finance to social networks. In the area of network security, a node that becomes a hub of high correlation with neighboring nodes might signal anomalous activity such as a coordinated flooding attack. In the area of computational biology the set of hubs of a gene expression correlation graph can serve as potential targets for drug treatment to block a pathway or modulate host response. In the area of finance a hub might indicate a vulnerable financial instrument or sector whose collapse might have major repercussions on the market. In the area of social networks a hub of observed interactions between criminal suspects could be an influential ringleader. The techniques and theory presented in this paper permit scalable and reliable screening for such hubs. This paper extends our previous work on correlation screening [arXiv:1102.1204] to the more challenging problem of partial correlation screening for variables with a high degree of connectivity. In particular we consider 1) extension to the more difficult problem of screening for partial correlations exceeding a specified magnitude; 2) extension to screening variables whose vertex degree in the associated partial correlation graph, often called the concentration graph, exceeds a specified degree.

研究の動機と目的

  • サンプル数 $ n $ が変数数 $ p $ よりも著しく小さい高次元グラフィカルモデルにおいて、多数の他の変数と強い部分相関を持つハブ変数(強い接続を持つ変数)を同定する課題に対処すること。
  • 変数の次元削減や尤度最大化を必要とせず、直接的に誤検出数を制御する計算効率の良いスクリーニング手法を開発すること。
  • 弱い依存性とスパースな帰無共分散仮定の下で、理論的フェーズ遷移閾値と漸近的p値を提供すること。
  • 大規模な遺伝子発現データ(例:乳がん研究)において、生物学的に関連性のあるハブの信頼できる同定を可能にすること。
  • 相関に基づくスクリーニングを、複雑なシステムにおける条件付き依存関係をよりよく捉える部分相関グラフに拡張すること。

提案手法

  • データの各列を標準 $ n $ 変数Zスコアに変換し、標本相関行列を表現することで、相関ベースのグラフの効率的計算を可能にする。
  • 標本相関行列のムーア・ペンローズ一般化逆行列を用いて、修正されたZスコアを導出し、標本部分相関行列を表現する。
  • 部分相関グラフにおけるエッジを特定するために閾値 $ \rho $ を適用し、次数 $ \geq \delta $ であるノードをハブと定義する。ここで $ \delta $ はユーザーが指定する最小次数である。
  • 大規模な $ p $、固定の $ n $、スパースな帰無共分散の下で、誤発見数の漸近的ポアソン極限理論を用い、フェーズ遷移閾値 $ \rho_c $ を得る。
  • 各変数 $ i $ について、異なる次数閾値 $ \delta $ におけるp値の軌跡 $ pv_\delta(i) $ を導出し、有意性によるハブの統計的ランク付けを可能にする。
  • p値の軌跡の解釈可能性を高めるために、$ \lambda_{\delta,\rho^*}(i) = -\log(1 - pv_\delta(i)) $ の変換を用い、対数-対数スケールで可視化する。

実験結果

リサーチクエスチョン

  • RQ1高次元部分相関グラフにおける誤ハブ発見の期待数を支配する理論的フェーズ遷移閾値 $ \rho_c $ は何か?
  • RQ2$ n \ll p $ の下で、スパースな帰無仮説のもとで、漸近的ポアソン近似を用いて誤発見率をどのように制御できるか?
  • RQ3提案されたハブスクリーニング手法は、事前の変数次元削減を要せず、高次元遺伝子発現データにおいて生物学的に有意なハブを信頼性高く同定できるか?
  • RQ4異なる次数閾値 $ \delta $ におけるp値の軌跡は、同定されたハブの統計的有意性と頑健性をどのように反映するか?
  • RQ5実世界のデータセット(例:NKI乳がんデータセット)において、予測された誤検出数と実際の観測値との一致度(忠実度)はどの程度か?

主な発見

  • 本手法は誤検出数の予測において高い忠実度を達成した:$ \delta=1 $ の場合、予測平均で8,531個の誤ハブが予測され、NKIデータセットで実際に8,492個の発見が確認された。
  • $ \delta=5 $ の場合、予測誤ハブ数は2個であったが、観測された誤発見数は4個であり、第1種の誤り(type I error)が堅実に制御されていることが示された。
  • IGL@、ARRB2、CTAG2、IL14などの遺伝子は、$ 10^{-25} $ 未満のp値を示し、特に低い頂点次数において顕著に有意であった。
  • IGL@のp値の軌跡は、すべての $ \delta $ において極めて有意なままであり、一貫した強く強い部分相関接続性を示した。
  • 本手法は合計で58個のハブ遺伝子を同定したが、特に顕著な遺伝子は乳がんおよび免疫応答に関連する生物学的意義を強く示した。
  • 次元削減を事前に要しない24,481個の遺伝子をすべて直接処理できるため、lasso型手法を上回る性能を発揮した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。