Skip to main content
QUICK REVIEW

[論文レビュー] FS^3: A Sampling based method for top-k Frequent Subgraph Mining

Tanay Kumar Saha, Mohammad Al Hasan|arXiv (Cornell University)|Sep 2, 2014
Data Mining Algorithms and Applications被引用数 3
ひとこと要約

FS³ は、固定サイズの部分グラフ上のマルコフ連鎖モンテカルロ(MCMC)サンプリングを用い、スコア関数により頻度の高い部分グラフを優先することで、トップ-k頻度部分グラフ抽出を実現するサンプリングベースの手法である。計算的に高価な部分グラフ同型判定問題を解くことなく、大規模グラフにおいても高い正確性(例:54.2% pr@500)を1時間未塔で達成でき、従来の手法が失敗する場面でもスケーラビリティを実現する。

ABSTRACT

Mining labeled subgraph is a popular research task in data mining because of its potential application in many different scientific domains. All the existing methods for this task explicitly or implicitly solve the subgraph isomorphism task which is computationally expensive, so they suffer from the lack of scalability problem when the graphs in the input database are large. In this work, we propose FS^3, which is a sampling based method. It mines a small collection of subgraphs that are most frequent in the probabilistic sense. FS^3 performs a Markov Chain Monte Carlo (MCMC) sampling over the space of a fixed-size subgraphs such that the potentially frequent subgraphs are sampled more often. Besides, FS^3 is equipped with an innovative queue manager. It stores the sampled subgraph in a finite queue over the course of mining in such a manner that the top-k positions in the queue contain the most frequent subgraphs. Our experiments on database of large graphs show that FS^3 is efficient, and it obtains subgraphs that are the most frequent amongst the subgraphs of a given size.

研究の動機と目的

  • 部分グラフ同型判定と全列挙に依存する従来の頻度部分グラフ抽出(FSM)アルゴリズムのスケーラビリティの限界に対処すること。特に大規模グラフではこれらの手法が非現実的になる。
  • 部分グラフ空間の完全列挙を必要とせず、与えられたサイズの最も頻度の高い誘導部分グラフを効率的に同定する手法を開発すること。
  • 生物学的・社会的ネットワーク(例:タンパク質-タンパク質相互作用(PPI)ネットワーク)のような大規模ネットワークにおいて、正確なFSM手法の計算不能性を克服すること。
  • 正確なFSMの代替として確率的かつスケーラブルな手法を提供し、推定された部分グラフ頻度と実際の頻度の間のランク相関を高い水準で維持すること。
  • グラフ分類やインデキシングなどの後続タスクに適した、高速かつ近似的なトップ-k頻度部分グラフ抽出を可能にすること。

提案手法

  • 固定サイズの誘導部分グラフの空間上でマルコフ連鎖モンテカルロ(MCMC)サンプリングを実行し、部分グラフスコア関数 $ s_1(G) $ および $ s_2(G) $ を用いたターゲット分布を定義することで、頻度が高くなる可能性のある部分グラフを優先する。
  • 有限サイズの優先度キューを用いて、最も頻繁にサンプリングされたトップ-k部分グラフを維持し、サンプリング頻度に応じて動的に更新する。
  • サンプリングおよびキューへの挿入時に効率的な同型判定を可能にするために、部分グラフに正規化コードを生成する。
  • Gelman-Rubin診断を用いた収束基準を導入し、複数のサンプリングチェーン間のジャカード距離を測定することで収束を検出する。
  • 局所的近傍統計に基づくスコア関数を導入し、部分グラフ同型判定の完全なチェックに依存するのを減らす。
  • サンプリング時間に比べて無視できるほど小さい正規化コード生成およびキュー挿入のオーバーヘッドを最小化することで、性能を最適化する。

実験結果

リサーチクエスチョン

  • RQ1大規模グラフにおいて、サンプリングベースのアプローチが正確なFSMアルゴリズムに比べ、実行時間とスケーラビリティの面で優れているか?
  • RQ2非一様ターゲット分布($ s_1 $ もしくは $ s_2 $ に基づく)を用いたMCMCサンプリングは、一様サンプリングに比べ、トップ-k頻度部分グラフの回復精度を向上させるか?
  • RQ3優先度キューのサイズが、トップ-k部分グラフ回復の正確性とメモリ使用量に与える影響は?
  • RQ4収束に基づく停止基準(Gelman-Rubin診断)は、十分なサンプリングが行われたかどうかを効果的に特定できるか?
  • RQ5異なるグラフデータセット(部分グラフ空間の複雑さが異なる)において、FS³の性能はどれほど頑健か?

主な発見

  • PSデータセットでは、$ s_2 $ スコア関数を用いたFS³が、70分以内に54.2% pr@500を達成した。同じ時間制約下で一様サンプリング(52.3% pr@500)に比べ顕著に優れていた。
  • PSデータセットにおける部分グラフサイズ8では、Mutagenデータセットで10分以内に90%を超えるpr@500を達成し、小さな部分グラフ空間においても優れた性能を示した。
  • 推定された部分グラフ頻度と実際の頻度の間のケンダールタウ相関は、常に高く(例:2.0のターゲット分布で55.4)、強いランク相関を示した。
  • 実行時間は部分グラフサイズ $ p $ にほぼ線形に増加し、サンプリング時間が実行時間の大部分を占めており、キュー挿入のオーバーヘッドは無視できるほど小さかった。
  • $ k $ 値(100〜500)の変化に関わらず性能が安定しており、精度およびケンダールタウ値の変動が最小限に抑えられ、$ k $ に対して頑健であることが示された。
  • Gelman-Rubin診断では、反復回数を増やすにつれてチェーン間のジャカード距離が減少し、収束が確認され、停止基準の妥当性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。