Skip to main content
QUICK REVIEW

[論文レビュー] Learning modular structures from network data and node variables

Elham Azizi, James E. Galagan|arXiv (Cornell University)|May 11, 2014
Gene Regulatory Network Analysis参考文献 34被引用数 9
ひとこと要約

本稿では、ネットワークデータ(例:タンパク質-DNA結合、SNSのフォロー関係)とノード固有の変数(例:遺伝子発現、ユーザーの活動)を統合する新しい確率的モデルを提案する。このモデルは、モジュラーな依存構造を複雑なシステムで学習することを目的としており、スティルスティック・ブロックモデルとモジュールネットワークを組み合わせ、逆遷移MCMCを用いた推論により、識別可能性を向上させ、誤検出を低減し、合成データ、マイコバクテリウム・チバクロススの遺伝子ネットワーク、およびTwitterのSNSにおいて、規制構造と影響構造を正確に回復する。

ABSTRACT

A standard technique for understanding underlying dependency structures among a set of variables posits a shared conditional probability distribution for the variables measured on individuals within a group. This approach is often referred to as module networks, where individuals are represented by nodes in a network, groups are termed modules, and the focus is on estimating the network structure among modules. However, estimation solely from node-specific variables can lead to spurious dependencies, and unverifiable structural assumptions are often used for regularization. Here, we propose an extended model that leverages direct observations about the network in addition to node-specific variables. By integrating complementary data types, we avoid the need for structural assumptions. We illustrate theoretical and practical significance of the model and develop a reversible-jump MCMC learning procedure for learning modules and model parameters. We demonstrate the method accuracy in predicting modular structures from synthetic data and capability to learn influence structures in twitter data and regulatory modules in the Mycobacterium tuberculosis gene regulatory network.

研究の動機と目的

  • ノード変数のみからモジュールネットワークを推定する際の高い誤検出率を是正すること。これは、観察されない交絡要因や検証不能な構造的仮定に起因する。
  • ノードレベルの測定値に加えて、補完的なネットワークデータ(例:ChIP-Seq、SNSのフォロー関係)を統合することで、依存構造学習におけるモデルの不確定性と同定不能性を克服すること。
  • 物理的または観察可能なネットワーク相互作用を、潜在的依存関係の制約として用いることで、恣意的な正則化を回避するスケーラブルで統計的に堅牢な手法を開発すること。
  • 実世界の生物学的および社会的ネットワークにおいて、条件特異的な規制プログラムと影響コミュニティの発見を可能にすること。
  • 組み合わせプログラムを各モジュールごとに用いることで、グローバルな依存構造と条件特異的規制効果を統合的にモデル化するフレームワークを提供すること。

提案手法

  • ノードが潜在的モジュールに割り当てられ、依存関係が共有される条件付き分布によって制御される、モジュールネットワークとスティルスティック・ブロックモデルを統合した確率的モデルを提案する。
  • ネットワークデータ(例:ChIP-Seqからの有向エッジ、フォローシステム)を用いてブロック構造を定義し、可能な親モジュールの空間を制限することで、計算の実行可能性を向上させる。
  • 2種類の規制効果を組み込む:共有親構造に起因する小さなグローバルシフトと、親の活性度に基づく大きな条件特異的効果。後者は組み合わせプログラムでモデル化される。
  • 逆遷移マルコフ連鎖モンテカルロ(RJ-MCMC)アルゴリズムを用いて、モジュールの割り当て、親構造、モデルパラメータを同時に推定し、モデル空間の探索を可能にする。
  • パラメータ推定にはギブスサンプリングを用い、尤度の多峰性に対するロバストネスを向上させ、決定的最適化手法よりも優れる。
  • 遺伝子発現、タンパク質-DNA結合、ユーザー活動、SNSグラフといった複数のデータソースを統合し、一貫した推論フレームワークを構築する。

実験結果

リサーチクエスチョン

  • RQ1ノード固有の変数に加えてネットワーク相互作用データを統合することで、ノード変数のみを用いた場合と比較して、モジュラー依存構造の識別可能性と正確性が向上するか?
  • RQ2物理的または観察可能なネットワーク相互作用を組み込むことで、モジュールネットワーク推定における誤検出依存関係がどの程度低減されるか?
  • RQ3提案手法は、遺伝子調節ネットワークにおけるフィードフォワードループといった既知の生物学的調節機構をどの程度正確に回復できるか?
  • RQ4活動パターンとフォローシステムのみを用いて、SNSにおける解釈可能な影響コミュニティと主要インフルエンサーを同定できるか?
  • RQ5実際の生物学的および社会的ネットワークにおけるリンク予測評価において、標準的なモジュールネットワークと比較して、本手法の性能はどの程度向上するか?

主な発見

  • マイコバクテリウム・チバクロススのDosR調節因子におけるリンク予測において、提案手法は75.4%の精度と93.4%の再現率を達成した。ノード変数のみを用いたモジュールネットワークは40.1%の精度と76.3%の再現率にとどまり、著しく劣っていた。
  • KstR調節因子において、提案手法は83.6%の精度と95.6%の再現率を達成した。これに対してノード変数のみのモジュールネットワークは35.8%の精度と67.4%の再現率であった。
  • Twitterデータでは、M13がBrian Solisらの著者に影響を受けており、M16がTantek Celikらの技術者に影響を受けており、ハッシュタグパターンが2009年の主要出来事と一致する共通のインフルエンサーを有するコミュニティを効果的に同定した。
  • 本モデルは、マイコバクテリウム・チバクロススにおけるリピートループや、脂質代謝および低酸素適応における条件特異的調節といった生物学的に意味のある規制プログラムを明らかにした。
  • ネットワークデータの使用により、モデルの識別可能性が向上した。一方、ノード変数のみでは交絡要因と過剰適合のため、同定不能な構造が生じた。
  • 逆遷移MCMCは、固定された構造的仮定に依存せずに、モジュール構造、親集合、パラメータの同時推定を可能にする複雑なモデル空間を効果的に探索した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。