Skip to main content
QUICK REVIEW

[論文レビュー] An Efficient Probabilistic Approach for Graph Similarity Search

Zijian Li, Xun Jian|arXiv (Cornell University)|Jun 17, 2017
Graph Theory and Algorithms被引用数 3
ひとこと要約

本稿では、グラフ編集距離(GED)の多項式時間で計算可能な代替指標としてグラフブランチ距離(GBD)を導入することで、効率的なグラフ類似度検索のための新しい確率的アプローチGBDAを提案する。GBDとGEDの間の確率的関係をモデル化することにより、GEDの高速かつ高精度な推定が可能となり、正確な手法に比べて大幅に効率性とスケーラビリティが向上する一方で、実データおよび合成データセットにおいても高い再現率とリ叫率を維持する。

ABSTRACT

Graph similarity search is a common and fundamental operation in graph databases. One of the most popular graph similarity measures is the Graph Edit Distance (GED) mainly because of its broad applicability and high interpretability. Despite its prevalence, exact GED computation is proved to be NP-hard, which could result in unsatisfactory computational efficiency on large graphs. However, exactly accurate search results are usually unnecessary for real-world applications especially when the responsiveness is far more important than the accuracy. Thus, in this paper, we propose a novel probabilistic approach to efficiently estimate GED, which is further leveraged for the graph similarity search. Specifically, we first take branches as elementary structures in graphs, and introduce a novel graph similarity measure by comparing branches between graphs, i.e., Graph Branch Distance (GBD), which can be efficiently calculated in polynomial time. Then, we formulate the relationship between GED and GBD by considering branch variations as the result ascribed to graph edit operations, and model this process by probabilistic approaches. By applying our model, the GED between any two graphs can be efficiently estimated by their GBD, and these estimations are finally utilized in the graph similarity search. Extensive experiments show that our approach has better accuracy, efficiency and scalability than other comparable methods in the graph similarity search over real and synthetic data sets.

研究の動機と目的

  • 大規模なグラフデータベースにおける正確なグラフ編集距離(GED)計算のNP困難な計算複雑性に対処すること。
  • 応答性が重要な実世界の応用においても高い精度を維持する、スケーラブルで効率的な正確なGED計算の代替手法を開発すること。
  • グラフブランチ距離(GBD)とGEDの間の確率的モデルを確立し、多項式時間で計算可能なGBDを用いてGEDを高速に推定すること。
  • 実データおよび合成データセットにおいて、既存の近似GED手法に比べて、精度、効率性、スケーラビリティの面で優れていること。

提案手法

  • グラフ間の構造的ブランチを比較することで、O(nd)時間で計算可能な新しいグラフ類似度測定指標としてグラフブランチ距離(GBD)を導入する。
  • ブランチの変動をグラフ編集操作の結果とみなして、GBDとGEDの関係を確率的フレームワークを用いてモデル化し、GBDからGEDを推定する。
  • GBD値をGED推定値にマッピングする確率的推定モデルを採用し、ブランチを貫く編集操作の統計的分布を活用する。
  • フィルタ・バリデーションフレームワークに推定されたGED値を適用し、高価な正確なGED計算の必要性を低減する。
  • LSAPベースの比較のためのハンガリアン法の変種およびグリーディー・ソーティングを用い、評価のベースラインとして使用する。
  • パラメータチューニング(例:GBDA-V2におけるw)およびサンプリング(GBDA-V1におけるα)を用いて、さまざまな類似度しきい値における性能最適化を図る。

実験結果

リサーチクエスチョン

  • RQ1グラフブランチ距離(GBD)は、大規模なグラフ類似度検索において、効率的かつ正確なグラフ編集距離(GED)の代理として機能できるか?
  • RQ2GBDとGEDの間にはどのような確率的関係があり、それをどのようにモデル化することで信頼性のあるGED推定が可能になるか?
  • RQ3提案手法GBDAは、既存の近似GED手法と比較して、精度、効率性、スケーラビリティの面で優れているか?
  • RQ4GBDA手法は、さまざまな実世界および合成グラフデータセット、および多様な類似度しきい値の下でも高い再現率とリ叫率を維持できるか?

主な発見

  • 実データセットにおいて、類似度しきい値τ ≤ 4の範囲でGBDAはGBDA-V1よりも高いF1スコアを達成し、低しきい値検索シナリオにおける優れた精度を示している。
  • τ ≥ 5の範囲では、GBDAはGBDA-V1と同等のF1スコアを維持しており、広範な類似度しきい値範囲で一貫した性能を示している。
  • AASDおよびFingerprintデータセットでは、τ ≤ 2の範囲でGBDAはGBDA-V2を上回るか、同等の性能を示し、Fingerprintデータセットではτ ≥ 3の範囲でわずかな劣化しか示さないため、強いロバストネスを示している。
  • すべてのテスト済みデータセットにおいて、GBDAはLSAPベースの手法(正確およびグリーディー)およびグラフシリアリゼーションに比べ、F1スコアおよび計算効率の面で顕著に優れている。
  • GBD計算(O(nd))が計算複雑性の主因となるため、数百ノードを有する大規模グラフに対しても効果的にスケーリング可能である。
  • 確率的モデルは、ブランチの変動を通じて編集操作の分布を的確に捉えており、正確な計算を伴わずに高精度なGED推定を可能としている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。