Skip to main content
QUICK REVIEW

[論文レビュー] High-dimensional Graphical Model Search with gRapHD R Package

Gabriel C. G. de Abreu, Rodrigo Labouriau|arXiv (Cornell University)|Sep 7, 2009
Data Visualization and Analytics参考文献 18被引用数 14
ひとこと要約

この論文は、離散変数、連続変数、または混合変数を含むデータにおいて、最適な森(フォレスト)および分解可能モデルを特定するために情報量基準(AIC/BIC)を用いた、高次元グラフィカルモデル選択を効率的に行うgRapHD Rパッケージを紹介する。この手法は、大規模なネットワークにおける条件付き独立構造のスケーラブルな推論を可能にし、遺伝子発現、SNP、形態的データの多様な分野で実証されている。可視化および複雑なグラフの構造的分析も支援する。

ABSTRACT

This paper presents the R package gRapHD for efficient selection of high-dimensional undirected graphical models. The package provides tools for selecting trees, forests and decomposable models minimizing information criteria such as AIC or BIC, and for displaying the independence graphs of the models. It has also some useful tools for analysing graphical structures. It supports the use of discrete, continuous, or both types of variables simultaneously.

研究の動機と目的

  • 多くの変数を含む高次元データに対するグラフィカルモデルの適合における計算的・統計的課題に対処すること。
  • 情報量基準(AIC/BIC)を用いて、特に森および分解可能モデルを対象とした、効率的かつスケーラブルな無向グラフィカルモデル選択手法を提供すること。
  • ゲノム研究やシステム生物学で一般的な高次元設定において、離散変数、連続変数、または両方を含む混合型データをサポートすること。
  • 高次元データからの条件付き独立グラフの可視化および構造的分析を可能にすること。
  • とくにスパースグラフィカルモデルに対して、従来の手法と比較して計算的に効率的な代替手法を提供すること。

提案手法

  • パッケージは、情報量基準(AICまたはBIC)を最小化することで最適なフォレストモデルを探索するminForest関数を用いる。
  • stepw関数は、同じ基準に基づいて最適な分解可能グラフィカルモデルを段階的探索する。
  • グラフィカルモデルは無向グラフとして表現され、エッジは条件付き依存を示し、エッジの欠如は他の変数を条件としての条件付き独立性を示す。
  • 適切な指数型分布族と条件付き独立構造を用いることで、混合データタイプ(離散・連続)をサポートする。
  • グラフ可視化には[14]のレイアウトアルゴリズムを採用し、ノードの色分け、ラベル付け、部分構造の強調表示をカスタマイズ可能である。
  • 短経路探索(shortPath)やコンponents検出機能により、グラフ内の最短経路および連結成分を同定する構造的分析機能を提供する。

実験結果

リサーチクエスチョン

  • RQ1変数数が標本サイズを上回る高次元データにおいて、どのように効率的にグラフィカルモデルを選択できるか?
  • RQ2情報量基準(AIC/BIC)に基づくモデル選択は、高次元設定下でスパースグラフィカルモデルを効果的に同定できるか?
  • RQ3連続変数と離散変数を併せ持つ混合型データを、無向グラフィカルフレームワーク内でどのように統合的にモデル化できるか?
  • RQ4実際の生物学的データにおける高次元条件付き独立グラフの構造的性質(例:直径、コンponents分布)は何か?
  • RQ5高次元性と計算制約の下でも、複雑なグラフィカルモデルを効果的に可視化・探索するにはどうすればよいか?

主な発見

  • gRapHDパッケージは、1,545個のプローブを含む歯周炎データにおいて、直径46、最長最短経路26の遺伝子共発現ネットワークを効果的に同定した。
  • HapMapのSNPデータ(606個のSNP)において、複数の連結成分を有する分解可能モデルが検出され、最大のコンponentは79ノードを有した。
  • Irisデータセットにおいて、連続測定値と品種分類の両方を含む混合グラフィカルモデルが同定され、条件付き独立構造が適切に捉えられた。
  • shortPath関数により、歯周炎ネットワークにおけるノード670が20個の直接隣接ノードを持ち、最も遠いノードまでの距離が26であることが明らかになった。
  • 可視化関数により、特定のノードおよびその近傍(例:ノード1,123と670の10近傍を赤・青で強調表示)を効果的に強調表示できた。
  • パッケージは高次元データにおいてスケーラブルであることが示され、スパースモデルでは計算性能が良好にスケーリングしたが、数値的制約により最大65,000変数までに制限された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。