Skip to main content
QUICK REVIEW

[论文解读] A comparative study of similarity-based and GNN-based link prediction approaches

Kamrul Islam, Sabeur Aridhi|arXiv (Cornell University)|Aug 20, 2020
Advanced Graph Neural Networks参考文献 52被引用 6
一句话总结

本文在十组基准数据集上对比了基于相似性的方法与基于图神经网络(GNN)的链接预测方法在同构图上的表现,评估了其预测准确率与计算效率。基于GNN的方法在预测准确率上优于基于相似性的方法,但计算时间显著更长,尤其在大规模图上表现更为明显。

ABSTRACT

The task of inferring the missing links in a graph based on its current structure is referred to as link prediction. Link prediction methods that are based on pairwise node similarity are well-established approaches in the literature. They show good prediction performance in many real-world graphs though they are heuristics and lack of universal applicability. On the other hand, the success of neural networks for classification tasks in various domains leads researchers to study them in graphs. When a neural network can operate directly on the graph, then it is termed as the graph neural network (GNN). GNN is able to learn hidden features from graphs which can be used for link prediction task in graphs. Link predictions based on GNNs have gained much attention of researchers due to their convincing high performance in many real-world graphs. This appraisal paper studies some similarity and GNN-based link prediction approaches in the domain of homogeneous graphs that consists of a single type of (attributed) nodes and single type of pairwise links. We evaluate the studied approaches against several benchmark graphs with different properties from various domains.

研究动机与目标

  • 评估并比较基于相似性的方法与基于GNN的链接预测方法在同构图上的性能。
  • 分析在不同图类型中,预测准确率与计算效率之间的权衡。
  • 从可扩展性与对不同图结构的适应性角度,识别每种方法的优势与局限性。
  • 为研究人员提供实用指南,依据图的大小与性能需求选择合适的链接预测方法。

提出的方法

  • 评估了13种基于相似性的链接预测方法,包括共同邻居(CN)、Jaccard指数(JA)、资源分配(RA)等,利用节点邻域与局部拓扑特征。
  • 评估了6种基于GNN的方法:WLNM、SEAL等,这些方法通过消息传递与图卷积机制学习节点表示。
  • 使用k值精度(P@k)与平均平均精度(MAP)作为评估指标,比较预测性能。
  • 测量了在不同大小、平均度与聚类系数的图上,每种方法的计算时间。
  • 采用无阈值评估方法,计算所有k排名预测的精度,避免依赖于任意的相似度分数阈值。
  • 使用来自不同领域(如社交网络、知识图谱、蛋白质相互作用网络)的基准图,以确保结果的泛化能力。

实验结果

研究问题

  • RQ1在不同类型的同构图中,基于相似性的方法与基于GNN的方法在预测准确率方面有何差异?
  • RQ2基于相似性的方法与基于GNN的方法之间的计算成本差异如何?其随图大小的增长趋势如何?
  • RQ3哪些图属性(如平均度、聚类系数、稀疏性)对每种方法的性能与效率影响最大?
  • RQ4基于GNN的方法是否能在包括稀疏与密集网络在内的各类图中,持续优于基于启发式相似性的方法?
  • RQ5与纯结构图相比,属性丰富的图(如USAir、YAGO3-10)对基于GNN的方法的计算时间有何影响?

主要发现

  • 基于GNN的方法,特别是SEAL,在所有基准图上均达到最高的预测准确率,其平均平均精度(MAP)优于所有基于相似性的方法。
  • 基于相似性的方法如PA与CAR的计算时间最低,其中PA因采用简单的度乘积运算而成为最快的方法。
  • 在基于相似性的方法中,CCLP的计算成本最高,因其需探索三级邻居;而在所有方法中,SEAL的计算时间最长。
  • GNN的计算时间随图大小增长的速度远超基于相似性的方法;例如,SEAL从USAir到YAGO3-10的计算时间增加了2189 ms,而PA仅增加了629 ms。
  • 尽管准确率更高,但GNN(如SEAL)在大规模图上效率仍低于基于相似性的方法,主要由于训练与表示学习的开销。
  • 在密集图(如PB与NS)中,GNN与基于相似性的方法之间的性能差距最为显著,因为GNN能更有效地利用结构复杂性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。