Skip to main content
QUICK REVIEW

[論文レビュー] Compact Neighborhood Index for Subgraph Queries in Massive Graphs

Chemseddine Nabti, T. Mecharnia|arXiv (Cornell University)|Mar 16, 2017
Graph Theory and Algorithms参考文献 25被引用数 3
ひとこと要約

本稿では、頂点の近傍を整数に符号化するためのコンパクトな近傍インデックス(CNI)を用いる、新しい部分グラフ同型写像アルゴリズムCNI-Matchを提案する。これにより、主記憶に依存しない効率的な探索空間の削減が可能となり、中間結果を削減する。実世界のグラフにおいて、CFL-Matchと比較して最大17倍の高速化と最大2,343倍のメモリ効率向上を達成した。

ABSTRACT

Subgraph queries also known as subgraph isomorphism search is a fundamental problem in querying graph-like structured data. It consists to enumerate the subgraphs of a data graph that match a query graph. This problem arises in many real-world applications related to query processing or pattern recognition such as computer vision, social network analysis, bioinformatic and big data analytic. Subgraph isomorphism search knows a lot of investigations and solutions mainly because of its importance and use but also because of its NP-completeness. Existing solutions use filtering mechanisms and optimise the order within witch the query vertices are matched on the data vertices to obtain acceptable processing times. However, existing approaches are iterative and generate several intermediate results. They also require that the data graph is loaded in main memory and consequently are not adapted to large graphs that do not fit into memory or are accessed by streams. To tackle this problem, we propose a new approach based on concepts widely different from existing works. Our approach distills the semantic and topological information that surround a vertex into a simple integer. This simple vertex encoding that can be computed and updated incrementally reduces considerably intermediate results and avoid to load the entire data graph into main memory. We evaluate our approach on several real-word datasets. The experimental results show that our approach is efficient and scalable.

研究の動機と目的

  • 主記憶に全体のデータグラフをロードする必要がある従来の部分グラフ同型写像アルゴリズムのスケーラビリティ制限を解消すること。
  • 特に大規模またはストリーミング処理対象のグラフにおいて、近傍ベースのフィルタリングに伴う高い計算コストとメモリコストを低減すること。
  • 完全な近傍構造を保存せずに、トポロジー的および意味的近傍情報を捉える軽量でインクリメンタルな頂点符号化を設計すること。
  • コンパクトで更新可能なインデックスを用いて、マッチングプロセスの初期段階で探索空間を効果的に削減すること。
  • スパarselyおよびdenseな両方のグラフで高い性能を発揮し、中間結果の爆発的増加を最小限に抑えること。

提案手法

  • 各頂点の1ホップ近傍をラベル頻度と構造的特徴の組み合わせにより1つの整数にマッピングするコンパクトな近傍インデックス(CNI)を提案する。
  • CNIを用いてグローバルフィルタリングを実行する:クエリ頂点が要請する近傍シグネチャと一致しないデータ頂点は、プルーニングされる。
  • グラフ処理やストリーミング処理中に効率的に維持可能な、CNIのインクリメンタル更新メカニズムを設計する。
  • 部分グラフ同型写像の再帰的バックトラッキングアルゴリズムにCNIを統合し、頂点マッチングの前にプルーニングを適用する。
  • CNIを拡張するための合成関数 $ cni_d(u) = g_2(\text{label}(u), cni(u)) $ を用い、頂点ラベルを組み込み、より豊かな意味的フィルタリングを可能にする。
  • グラフレベルのCNIを $ cni(G) = g_{|V(G)|}(cni_d(v_1), cni_d(v_2), ..., cni_d(v_{|V(G)|})) $ として構築し、グラフデータベースインデキシングへの応用を想定する。

実験結果

リサーチクエスチョン

  • RQ1完全な近傍構造を保存せずに、頂点近傍のコンパクトで整数ベースの表現が、部分グラフ同型写像における探索空間を顕著に縮小できるか?
  • RQ2CNIベースのフィルタリングは、NLF や MND といった従来手法と比較して、プルーニング力と計算コストの両面で優れているか?
  • RQ3主記憶に収まらない大規模グラフにおいて、CNIアプローチはどの程度スケーリング可能か?
  • RQ4CFL-Matchに用いられるCPIのような従来のインデキシング構造と比較して、CNIの維持にかかるメモリおよび時間的オーバーヘッドはどれくらいか?
  • RQ5CNIはグラフデータベースインデキシングをサポートするように拡張可能か?また、グラフコレクションにおける効率的な類似度検索やクエリ処理を可能にするか?

主な発見

  • スパースなクエリにおいて、YEASTデータセットではCFL-Matchと比較して平均12倍の高速化、HPRDデータセットでは17倍の高速化を達成した。
  • 密度の高いHUMANデータセットでは、CFL-Matchが12時間以内に完了するクエリサイズにおいて、CNI-Matchは4倍速かった。
  • HPRDデータセットでは、CFL-Matchのメモリ使用量がCNI-Matchの最大2,343倍にのぼり、小規模なクエリでは最大6,000倍も多用した。
  • スパースなクエリでは、CNI-Matchのメモリ使用量はCFL-Matchの僅か一部に抑えられ、YEASTでは675倍、HPRDでは2,343倍の削減を達成した。
  • CNI-Matchのメモリ使用量はクエリサイズに応じて増加するが、CNIフィルタを通過した頂点のエッジのみを保存するため、管理可能である。
  • CNI-Matchは全クエリセットを12時間の制限内に処理できたが、CFL-Matchは密度の高いクエリ、特に大きなサイズのもので時間制限を超えてしまった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。