Skip to main content
QUICK REVIEW

[論文レビュー] Minfer: Inferring Motif Statistics From Sampled Edges

Pinghui Wang, John C. S. Lui|arXiv (Cornell University)|Feb 24, 2015
Complex Network Analysis Techniques参考文献 35被引用数 10
ひとこと要約

Minfer は、完全なトポロジーが不明な元のグラフの真のモチーフ統計を、ランダムにサンプリングされた RESampled グラフから推定する新しいフレームワークである。確率的モデルとフィッシャー情報に基づく誤差バウンドを用いて、大規模ネットワークにおけるモチーフ濃度を正確に推定する。実世界のデータセット(LiveJournal や com-DBLP など)を用いた実験では、低NRMSE とタイトな誤差バウンドを達成した。

ABSTRACT

Characterizing motif (i.e., locally connected subgraph patterns) statistics is important for understanding complex networks such as online social networks and communication networks. Previous work made the strong assumption that the graph topology of interest is known, and that the dataset either fits into main memory or stored on disks such that it is not expensive to obtain all neighbors of any given node. In practice, researchers have to deal with the situation where the graph topology is unknown, either because the graph is dynamic, or because it is expensive to collect and store all topological and meta information on disk. Hence, what is available to researchers is only a snapshot of the graph generated by sampling edges from the graph at random, which we called a "RESampled graph". Clearly, a RESampled graph's motif statistics may be quite different from the underlying original graph. To solve this challenge, we propose a framework and implement a system called Minfer, which can take the given RESampled graph and accurately infer the underlying graph's motif statistics. We also use Fisher information to bound the error of our estimates. Experiments using large scale datasets show that our method to be accurate.

研究の動機と目的

  • 完全なグラフトポロジーが入手不可である状況において、モチーフ統計を推定する課題に対処すること。
  • ランダムにエッジをサンプリングしたサブグラフから、元のグラフの潜在的なモチーフ頻度を正確に推定する手法を開発すること。
  • フィッシャー情報を用いて、モチーフ濃度推定の理論的誤差バウンドを提供すること。
  • 完全なグラフの可用性や効率的なネイバークエリを仮定する従来のサンプリングベースのモチーフ推定手法の限界を克服すること。

提案手法

  • サブグラフの包含確率から導出される確率的変換行列 P を用いて、元のグラフと RESampled グラフにおけるモチーフ統計の関係をモデル化する。
  • 変換行列 P の逆行列を用いて、RESampled グラフにおける観測済みモチーフ数から元のグラフのモチーフ数を推定する。
  • フィッシャー情報を用いて、モチーフ濃度推定の分散に対するクラーマー・ラオ低限(CRLB)を計算し、理論的誤差バウンドを可能にする。
  • 有向および無向ネットワークにおける 3 〜 5 ノードの連結およびインダクティブサブグラフ(CISes)に本手法を適用する。
  • サンプリング率(p = 0.1 から 0.3)を変化させた実世界のデータセット(LiveJournal, soc-Epinions, com-DBLP など)で手法を検証する。
  • 行列の逆行列計算とサブグラフ列挙を用いて、異なるモチーフクラスにおける変換行列 P 及びその逆行列を計算する。

実験結果

リサーチクエスチョン

  • RQ1ランダムにエッジをサンプリングした RESampled グラフから、元のグラフのモチーフ統計を正確に推定できるか?
  • RQ2完全なグラフトポロジーが入手不可な状況下で、モチーフ濃度推定の誤差を理論的にどのようにバウンドできるか?
  • RQ3サンプリング確率 p が、異なるネットワークタイプにおけるモチーフ推定の正確性に与える影響は何か?
  • RQ4真のモチーフ頻度が既知の実世界ネットワークにおいて、推定されたモチーフ濃度は真値とどのように比較されるか?

主な発見

  • Minfer はモチーフ濃度推定において低歪みの平均二乗誤差(NRMSE)を達成しており、サンプリング確率 p が高くなるほど NRMSE が低下する。
  • 5 ノードの無向モチーフでは、p = 0.3 時に NRMSE が最小となり、真の頻度が小さいモチーフ(6 番目、10 番目、13 番目、17 番目、18 番目のモチーフ)では NRMSE が最大となった。
  • 根本的なクラーマー・ラオ低限(RCRLB)は、観測された平均二乗誤差(RMSE)と常に近く、理論的誤差バウンドのタイトさが裏付けられた。
  • LiveJournal データセットでは、p = 0.01 時に 3 ノード有向モチーフの RCRLB と RMSE がほとんど区別できず、誤差バウンドの信頼性が高く示された。
  • com-DBLP(3.34×10^10)および ca-GrQc(3.64×10^7)における 5 ノード CISes のモチーフ頻度推定に成功し、大規模ネットワークへのスケーラビリティを示した。
  • 行列の逆行列アプローチにより、3 ノード符号付き、4 ノード無向、3 ノード有向サブグラフを含む多様なモチーフクラスにおいて、正確な推定が可能となった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。