Skip to main content
QUICK REVIEW

[論文レビュー] Large-Scale Network Motif Learning with Compression.

Peter Bloem, Steven de Rooij|arXiv (Cornell University)|Jan 8, 2017
Complex Network Analysis Techniques参考文献 35被引用数 5
ひとこと要約

本稿では、周辺性に基づく比較を、null モデルに置き換えるために最小記述長(MDL)原理を用いた、スケーラブルな大規模ネットワークモチーフ検出手法を提案する。繰り返しのランダムグラフサンプリングの必要性を排除することで、数十億のリンクを持つネットワークにおいても、計算コストを著しく削減しつつ、正確なモチーフ発見が可能になる。

ABSTRACT

We introduce a new learning method for network motifs: interesting or informative subgraph patterns in a network. Current methods for finding motifs rely on the frequency of the motif: specifically, subgraphs are motifs when their frequency in the data is high compared to the expected frequency under a null model. To compute this expectation, the search for motifs is normally repeated on as many as 1000 random graphs sampled from the null model, a prohibitively expensive step. We use ideas from the Minimum Description Length (MDL) literature to define a new measure of motif relevance. This has several advantages: the subgraph count on samples from the null model can be eliminated, and the search for motif candidates within the data itself can be greatly simplified. Our method allows motif analysis to scale to networks with billions of links, provided that a fast null model is used.

研究の動機と目的

  • null モデルの期待値を推定するために最大1000回のランダムグラフサンプリングを要する、現在のモチーフ検出手法の計算不能性を解消すること。
  • 数十億のリンクを持つ大規模ネットワークを分析可能なスケーラブルなモチーフ検出フレームワークを開発すること。
  • null モデルのサンプリングを回避し、サブグラフの情報量を捉えるMDLに基づく測定値に、頻度ベースのモチーフスコアリングを置き換えること。
  • 圧縮に基づく関連性を活用することで、モチーフ候補の探索を簡素化し、包括的なサンプリングに依存するのを減らすこと。

提案手法

  • サブグラフがネットワークデータをどの程度効果的に圧縮できるかに基づき、モチーフの関連性を定義するため、最小記述長(MDL)原理を採用する。
  • 観測されたグラフとランダム化されたグラフの間の頻度比較を、モチーフを用いてネットワークを符号化する際の複雑さを定量化する記述長指標に置き換える。
  • MDLスコアを用いて、ネットワークをどの程度効果的に圧縮できるかに基づきサブグラフをモチーフとしてランク付けし、null モデルからの繰り返しサンプリングを回避する。
  • 高速なnull モデル近似を統合することで、さらに計算を高速化し、大規模ネットワークへのスケーラビリティを実現する。
  • 圧縮効果が顕著なサブグラフにのみ注目することで、モチーフ候補の探索を簡素化し、探索空間を削減する。

実験結果

リサーチクエスチョン

  • RQ1頻度ベースのモチーフ検出を置き換える圧縮に基づく測定値は、正確性やスケーラビリティを損なわず、代替可能か?
  • RQ2ランダムグラフサンプリングの排除によって、モチーフ検出における計算コストはどの程度削減可能か?
  • RQ3従来の手法と比較して、MDLに基づく手法は数十億のリンクを持つネットワークにどの程度スケーリング可能か?
  • RQ4null モデルの期待値に依存せずに、MDLスコアは情報量の多いサブグラフパターンを効果的に特定できるか?

主な発見

  • MDLに基づく手法により、null モデルの期待値を推定するために1000回以上のランダムグラフサンプリングを実施する必要がなくなり、計算オーバーヘッドが著しく削減された。
  • コストの高いサンプリングを効率的な圧縮ベースのスコアリングに置き換えることで、数十億のリンクを持つネットワークにおけるモチーフ検出が可能になった。
  • MDLスコアは、ネットワーク圧縮に寄与するサブグラフの貢献度を測定することで、情報量の多いサブグラフパターンを効果的に特定した。
  • 圧縮効果が顕著なサブグラフにのみ注目することで、探索空間を削減し、モチーフ候補の探索を簡素化した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。