[论文解读] Revisiting Link Prediction: A Data Perspective
本文从数据中心视角重新审视链路预测,识别出三个关键因素——局部结构接近度、全局结构接近度和特征接近度——其相互作用决定了模型性能。研究发现,当链路形成由特征接近度驱动时,图神经网络用于链路预测(GNN4LP)表现不佳,这是由于其与局部结构接近度存在固有不兼容性,从而为改进模型选择与开发提供了新的设计原则和基准测试指南。
Link prediction, a fundamental task on graphs, has proven indispensable in various applications, e.g., friend recommendation, protein analysis, and drug interaction prediction. However, since datasets span a multitude of domains, they could have distinct underlying mechanisms of link formation. Evidence in existing literature underscores the absence of a universally best algorithm suitable for all datasets. In this paper, we endeavor to explore principles of link prediction across diverse datasets from a data-centric perspective. We recognize three fundamental factors critical to link prediction: local structural proximity, global structural proximity, and feature proximity. We then unearth relationships among those factors where (i) global structural proximity only shows effectiveness when local structural proximity is deficient. (ii) The incompatibility can be found between feature and structural proximity. Such incompatibility leads to GNNs for Link Prediction (GNN4LP) consistently underperforming on edges where the feature proximity factor dominates. Inspired by these new insights from a data perspective, we offer practical instruction for GNN4LP model design and guidelines for selecting appropriate benchmark datasets for more comprehensive evaluations.
研究动机与目标
- 探究为何在不同数据集上没有单一的GNN4LP模型能始终优于其他模型。
- 识别出超越模型架构的根本性数据因素,这些因素影响链路预测性能。
- 分析局部、全局和特征接近度因素之间的关系及潜在不兼容性。
- 基于数据特征,为GNN4LP模型设计和基准数据集选择提供可操作的指导方针。
- 挑战深层GNN或复杂架构普遍提升链路预测性能的假设,强调基于数据的设计原则。
提出的方法
- 识别出三个核心数据因素:局部结构接近度(如共同邻居)、全局结构接近度(如基于随机游走的度量)和特征接近度(如节点特征相似性)。
- 采用潜在空间模型从理论上证明所识别数据因素在链路预测中的有效性。
- 利用潜在空间模型分析三者之间的关系,揭示特征接近度与局部结构接近度之间存在根本性不兼容性。
- 在多样化的数据集(OGB和Planetoid)上进行实证评估,采用标准化的训练与评估协议,包含早停机制和固定的超参数范围。
- 在一致设置下,对比广泛的模型,包括启发式方法(CN、AA、RA)、GNN(GCN、GraphSAGE)以及专用的GNN4LP模型(SEAL、BUDDY、NCNC、NeoGNN)。
- 根据已发表的最佳设置调整超参数,以确保公平性,特别是对SEAL和BUDDY等计算开销较大的模型。

实验结果
研究问题
- RQ1局部、全局和特征接近度因素如何在多样化数据集上共同影响链路预测性能?
- RQ2全局结构接近度与局部结构接近度之间的关系如何决定模型的有效性?
- RQ3为何GNN4LP模型在以特征接近度为主导的边中表现持续不佳?
- RQ4特征接近度与局部结构接近度之间的不兼容性在多大程度上是导致不同数据集间性能差异的根本原因?
- RQ5如何利用数据中心的洞见指导更鲁棒的GNN4LP模型设计以及全面基准数据集的选择?
主要发现
- 全局结构接近度仅在局部结构接近度不足时提升性能,表明两者之间存在条件依赖关系。
- 特征接近度与局部结构接近度之间存在根本性不兼容性:在特征和局部结构均高度相似的边中极为罕见,导致GNN4LP模型在以特征驱动的链路中表现不佳。
- 在ogbl-ppa数据集上,NCNC取得62.64 ± 0.79 Hits@100,显著优于GCN(29.57 ± 2.90)和GraphSAGE(41.02 ± 1.94),表明其在特征丰富且共同邻居较多的边中表现强劲。
- 在ogbl-ddi上(缺乏节点特征),NCNC取得70.23 ± 12.11 Hits@100,优于GCN(49.90 ± 7.23)和GraphSAGE(49.84 ± 15.56),凸显了在无特征环境下结构模式的重要性。
- 在ogbl-ppa上,MLP基线仅取得0.45 ± 0.04 Hits@100,表明特征本身预测能力极弱,而NCNC在该设定下有效利用了结构模式。
- 无单一模型在所有数据集上持续占优:GCN在Cora和Citeseer上表现更优,而NCNC在ogbl-ppa和ogbl-ddi上表现突出,凸显了基于数据特征选择模型的必要性。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。