Skip to main content
QUICK REVIEW

[論文レビュー] Mining Frequent Patterns in Evolving Graphs

Çiğdem Aslay, Muhammad Anis Uddin Nasir|arXiv (Cornell University)|Sep 2, 2018
Data Mining Algorithms and Applications参考文献 33被引用数 5
ひとこと要約

本稿では、リザーバー・サンプリングとノードの近傍に基づくパターン拡張を用いて、変化するグラフにおける頻出連結部分グラフを抽出するストリーミングアルゴリズムを提案する。空間制約のもとで、代表的な頻出部分グラフのサンプルを効率的に維持し、濃度不等式による確率的保証をもって高い正確性を達成する。

ABSTRACT

Given a labeled graph, the frequent-subgraph mining (FSM) problem asks to find all the $k$-vertex subgraphs that appear with frequency greater than a given threshold. FSM has numerous applications ranging from biology to network science, as it provides a compact summary of the characteristics of the graph. However, the task is challenging, even more so for evolving graphs due to the streaming nature of the input and the exponential time complexity of the problem. In this paper, we initiate the study of the approximate FSM problem in both incremental and fully-dynamic streaming settings, where arbitrary edges can be added or removed from the graph. For each streaming setting, we propose algorithms that can extract a high-quality approximation of the frequent $k$-vertex subgraphs for a given threshold, at any given time instance, with high probability. In contrast to the existing state-of-the-art solutions that require iterating over the entire set of subgraphs for any update, our algorithms operate by maintaining a uniform sample of $k$-vertex subgraphs with optimized neighborhood-exploration procedures local to the updates. We provide theoretical analysis of the proposed algorithms and empirically demonstrate that the proposed algorithms generate high-quality results compared to baselines.

研究の動機と目的

  • エッジが段階的に追加される動的で変化するグラフにおける頻出連結部分グラフの抽出という課題に取り組む。
  • すべての部分グラフを保存せずに、頻出パターンの代表的サンプルを維持する空間効率の良いアルゴリズムを設計する。
  • 誤差の有界な確率的サンプリングを用いて、パターン頻度推定の高い正確性を確保する。
  • 大規模ネットワークにおける変化するグラフ構造のリアルタイム分析を可能にする。
  • 濃度不等式を用いて、サンプル化された頻出パターンの品質について理論的保証を提供する。

提案手法

  • 新しいエッジが到着するたびに、固定サイズのバッファを用いたリザーバー・サンプリングにより、頻出部分グラフのリザーバー・サンプルを更新する。
  • 各新しいエッジ (u,v) に対して、u と v の異なる深さの近傍を用いて、(u,v) によって拡張可能なすべての可能な連結部分グラフ H を探索する。
  • h ∈ [0,k-2] および j = k-2-h に対して、H ⊆ Nu,h^{t-1} ∪ Nv,j^{t-1} を計算し、G^{t-1} において H が連結であることを保証する。
  • H がサンプル集合 S にすでに存在するかどうかを確認する。もしそうであれば、リザーバー・サンプリングを用いて H′ = H ∪ {(u,v)} を S に置き換える。
  • サンプルサイズと誤差の境界を制御するため、パラメータ M = log(T_k / δ) · (4+ε)/ε² を用いたリザーバー・サンプリングを適用する。
  • この手法により、H′ が G^t において連結であることが保証され、濃度不等式を用いた確率的正確性保証が維持される。

実験結果

リサーチクエスチョン

  • RQ1どのようにして、エッジの逐次的更新が行われる動的グラフにおいて、頻出連結部分グラフを効率的に維持できるか?
  • RQ2変化するグラフにおける頻出部分グラフの代表的サンプルを維持するために、最小限の空間オーバーヘッドが必要か?
  • RQ3ストリーミング環境下で、部分グラフの頻度推定に対する確率的誤差境界をどのように強制できるか?
  • RQ4近傍の深さと部分グラフのサイズは、パターン抽出の正確性と効率性にどのような影響を与えるか?
  • RQ5リザーバー・サンプリング戦略を近傍拡張と効果的に組み合わせることで、高精度な頻出パターン検出を維持できるか?

主な発見

  • アルゴリズムは、M = log(T_k / δ) · (4+ε)/ε² で上限が定められたサンプルサイズを維持し、空間効率を確保する。
  • 濃度不等式により保証されるように、真の部分グラフ頻度の (1±ε)-近似が確率 1−δ 以上で達成される。
  • リザーバー・サンプリング機構により、各有効な部分グラフ H′ = H ∪ {(u,v)} がサンプル集合 S に均等に保持される確率が保証される。
  • G^{t-1} における連結性と S への属性を確認することで、非連結または非頻出部分グラフを効率的にプルーニングする。
  • 深さに基づく近傍インデックス(h と j)の使用により、全列挙を避けてスケーラブルな探索が可能になる。
  • 近隣のサイズが有界であると仮定すると、各エッジを候補部分グラフあたりほぼ定数時間で処理できるため、リアルタイム抽出をサポートする。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。