[论文解读] An Efficient Probabilistic Approach for Graph Similarity Search
本文提出GBDA,一种新颖的概率方法,通过引入图分支距离(GBD)作为图编辑距离(GED)的多项式时间可计算代理,实现高效的图相似性搜索。通过建模GBD与GED之间的概率关系,该方法能够快速、准确地估计GED,在保持高精度和高召回率的同时,显著提升了传统精确方法的效率和可扩展性,适用于真实和合成数据集。
Graph similarity search is a common and fundamental operation in graph databases. One of the most popular graph similarity measures is the Graph Edit Distance (GED) mainly because of its broad applicability and high interpretability. Despite its prevalence, exact GED computation is proved to be NP-hard, which could result in unsatisfactory computational efficiency on large graphs. However, exactly accurate search results are usually unnecessary for real-world applications especially when the responsiveness is far more important than the accuracy. Thus, in this paper, we propose a novel probabilistic approach to efficiently estimate GED, which is further leveraged for the graph similarity search. Specifically, we first take branches as elementary structures in graphs, and introduce a novel graph similarity measure by comparing branches between graphs, i.e., Graph Branch Distance (GBD), which can be efficiently calculated in polynomial time. Then, we formulate the relationship between GED and GBD by considering branch variations as the result ascribed to graph edit operations, and model this process by probabilistic approaches. By applying our model, the GED between any two graphs can be efficiently estimated by their GBD, and these estimations are finally utilized in the graph similarity search. Extensive experiments show that our approach has better accuracy, efficiency and scalability than other comparable methods in the graph similarity search over real and synthetic data sets.
研究动机与目标
- 解决大规模图数据库中精确图编辑距离(GED)计算的NP难复杂性问题。
- 开发一种可扩展、高效的精确GED计算替代方法,确保在响应速度至关重要的实际应用中保持高精度。
- 建立图分支距离(GBD)与GED之间的概率模型,实现通过多项式时间GBD计算快速估计GED。
- 在真实和合成图数据集上,相较于现有近似GED方法,在准确率、效率和可扩展性方面实现超越。
提出的方法
- 提出图分支距离(GBD)作为基于图之间结构分支比较的新图相似性度量,可在O(nd)时间内计算。
- 通过将分支变异视为图编辑操作的结果,采用概率框架建模GED与GBD之间的关系,从而从GBD估计GED。
- 采用概率估计模型,将GBD值映射为GED估计值,利用跨分支编辑操作的统计分布。
- 在过滤-验证框架中应用估计的GED值进行图相似性搜索,减少对昂贵精确GED计算的需求。
- 使用匈牙利算法的变体和贪心排序方法进行LSAP-based比较,作为评估的基线。
- 通过参数调优(如GBDA-V2中的w)和采样(GBDA-V1中的α)优化不同相似性阈值下的性能。
实验结果
研究问题
- RQ1图分支距离(GBD)能否在大规模图相似性搜索中作为高效且准确的图编辑距离(GED)代理?
- RQ2GBD与GED之间存在何种概率关系?如何建模该关系以实现可靠的GED估计?
- RQ3所提出的GBDA方法在准确率、效率和可扩展性方面与现有近似GED方法相比表现如何?
- RQ4GBDA方法在不同相似性阈值下,是否在多样化的真实世界和合成图数据集中均保持高召回率和高精度?
主要发现
- 在真实数据集上,对于相似性阈值τ ≤ 4,GBDA的F1得分高于GBDA-V1,表明在低阈值搜索场景下具有更优的准确性。
- 对于τ ≥ 5,GBDA与GBDA-V1保持相近的F1得分,表明在广泛相似性阈值范围内性能稳定。
- 在AASD和Fingerprint数据集上,GBDA在τ ≤ 2时优于或匹配GBDA-V2,且在Fingerprint数据集上τ ≥ 3时仅出现轻微退化,表明其具有强鲁棒性。
- 在所有测试数据集上,GBDA在F1得分和计算效率方面显著优于基于LSAP的方法(精确和贪心)以及图序列化方法。
- 该方法可有效扩展至大规模图,计算复杂度主要由GBD计算(O(nd))主导,使其适用于包含数百个顶点的图。
- 概率模型成功捕捉了通过分支变异反映的编辑操作分布,实现了无需精确计算即可准确估计GED。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。