[论文解读] CoSimGNN: Towards Large-scale Graph Similarity Computation
CoSimGNN 提出了一种新颖的 '嵌入-粗化-匹配' 框架,用于大规模图相似性计算,通过自适应图池化实现图的粗化,并利用细粒度的跨图注意力机制实现高效且准确的相似性评分。该方法在大规模图(最多 200 个节点)上的推理时间相比先前方法最快提升至 3 倍,实现了最先进性能。
The ability to compute similarity scores between graphs based on metrics such as Graph Edit Distance (GED) is important in many real-world applications. Computing exact GED values is typically an NP-hard problem and traditional algorithms usually achieve an unsatisfactory trade-off between accuracy and efficiency. Recently, Graph Neural Networks (GNNs) provide a data-driven solution for this task, which is more efficient while maintaining prediction accuracy in small graph (around 10 nodes per graph) similarity computation. Existing GNN-based methods, which either respectively embeds two graphs (lack of low-level cross-graph interactions) or deploy cross-graph interactions for whole graph pairs (redundant and time-consuming), are still not able to achieve competitive results when the number of nodes in graphs increases. In this paper, we focus on similarity computation for large-scale graphs and propose the "embedding-coarsening-matching" framework CoSimGNN, which first embeds and coarsens large graphs with adaptive pooling operation and then deploys fine-grained interactions on the coarsened graphs for final similarity scores. Furthermore, we create several synthetic datasets which provide new benchmarks for graph similarity computation. Detailed experiments on both synthetic and real-world datasets have been conducted and CoSimGNN achieves the best performance while the inference time is at most 1/3 of that of previous state-of-the-art.
研究动机与目标
- 解决大规模图相似性计算中效率与准确性难以平衡的关键挑战,传统方法面临 NP-难复杂度或高计算成本的问题。
- 克服现有基于 GNN 模型的局限性:嵌入模型缺乏跨图交互,而匹配模型因成对节点交互导致时间复杂度达二次方。
- 开发一种可扩展的框架,能够在不牺牲速度的前提下,捕捉大规模图(如 100–200 个节点)中的层次化和细粒度结构差异。
- 创建新的、高质量的合成数据集和真实世界数据集,配备准确的图编辑距离(GED)真实标签,用于大规模图相似性任务。
- 通过降低推理时间并保持高精度,实现图相似性搜索在生物信息学和社交网络分析等实际领域中的可部署性。
提出的方法
- 提出三阶段框架:(1) 通过 GNN 学习节点表示进行图编码,(2) 利用可学习池化层实现自适应图粗化,以减少图规模同时保留结构信息,(3) 通过粗化图之间的跨图注意力模块实现细粒度的跨图匹配。
- 引入一种自适应池化机制,可动态学习每张图的聚类中心,避免了先前池化方法中使用的固定、非图特定的中心点。
- 设计一种跨图交互注意力模块(M),实现粗化图中对应节点之间的低层级、节点级注意力,捕捉细微的结构差异。
- 在匹配阶段整合三个组件:节点特征(X)、节点重要性(I)和跨图注意力(M),消融实验验证了其各自及联合贡献。
- 构建合成数据集(BA-60、BA-100、BA-200),通过衍生图生成方法控制结构变化并获得真实 GED 标签,实现对大规模图的准确标注。
- 采用次指数近似算法,并通过最小修剪步数验证,获得更可靠的 GED 标签,克服了在大规模图上精确计算 GED 的不可行性。
实验结果
研究问题
- RQ1基于 GNN 的框架是否能在图规模超过 100 个节点时,同时实现高准确率与高效率的大规模图相似性计算?
- RQ2与固定池化或端到端嵌入方法相比,自适应图粗化在捕捉大规模图中层次化与局部结构特征方面有何改进?
- RQ3细粒度的跨图注意力机制相比全局图级嵌入或粗粒度交互,在提升相似性预测方面有多大增强作用?
- RQ4能否有效构建配备准确真实 GED 标签的合成数据集以用于大规模图相似性基准测试?这些数据集在模型评估中起到何种提升作用?
- RQ5匹配阶段的架构组件(X、I、M)对最终性能有何影响?哪个组件对准确率提升贡献最大?
主要发现
- CoSimGNN 在合成数据集和真实世界数据集上均表现最佳,在 BA-200 分类任务中达到 99.75% 的准确率,显著优于所有基线模型,包括 GCN-Mean、GCN-Max、GSimCNN 和 CoSim-Mem。
- 在 COIL-DEL 数据集上,CoSimGNN 达到 88.30% 的准确率,显著优于第二名方法(CoSim-Mem 的 83.85%),展现出在真实世界数据上的强大泛化能力。
- 在 GED 回归任务中,CoSimGNN 在 BA-200 数据集上实现 MSE 为 0.95、MAE 为 22.06,相比其他模型展现出更优的回归准确率。
- 消融实验表明,匹配阶段的所有组件(X、I、M)均不可或缺,其中跨图交互注意力模块(M)贡献最大,其移除导致准确率下降最明显。
- CoSimGNN 的推理时间最多仅为先前最先进方法的 1/3,使其在包含数百张图的数据库中进行大规模相似性搜索时具备极高的效率。
- 所提出的合成数据集(BA-60、BA-100、BA-200)提供了可靠且准确的 GED 标签——此前在大规模图上尚不存在——为大规模图相似性研究提供了稳健的基准和未来研究基础。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。