[论文解读] A Theory of Link Prediction via Relational Weisfeiler-Leman on Knowledge Graphs
本文提出条件消息传递神经网络(C-MPNNs),一种用于知识图谱链接预测的框架,通过基于源节点和查询关系的条件计算成对节点表示。该工作建立了C-MPNNs与关系型Weisfeiler-Leman算法之间的理论联系,证明其表达能力与该算法相当,并通过实证验证表明全局读出函数对于捕捉全局图结构至关重要,在一个合成数据集上,无读出函数的模型表现失败,而使用读出函数的模型达到100%准确率。
Graph neural networks are prominent models for representation learning over graph-structured data. While the capabilities and limitations of these models are well-understood for simple graphs, our understanding remains incomplete in the context of knowledge graphs. Our goal is to provide a systematic understanding of the landscape of graph neural networks for knowledge graphs pertaining to the prominent task of link prediction. Our analysis entails a unifying perspective on seemingly unrelated models and unlocks a series of other models. The expressive power of various models is characterized via a corresponding relational Weisfeiler-Leman algorithm. This analysis is extended to provide a precise logical characterization of the class of functions captured by a class of graph neural networks. The theoretical findings presented in this paper explain the benefits of some widely employed practical design choices, which are validated empirically.
研究动机与目标
- 为知识图谱中的图神经网络提供系统性的理论理解,特别是针对链接预测任务。
- 通过基于条件消息传递的统一框架,整合看似不同的链接预测模型。
- 利用关系型Weisfeiler-Leman算法和逻辑形式化方法,刻画这些模型的表达能力。
- 通过实证方法验证理论洞见,尤其是全局读出函数在捕捉全局图结构方面的作用。
- 通过所提出的框架解释NBFNets等模型的实证成功,归因于其在该框架内的高表达能力。
提出的方法
- 提出条件消息传递神经网络(C-MPNNs),其中节点表示基于源节点u和查询关系q进行条件化,实现成对表示学习。
- 引入一种专为知识图谱设计的关系型Weisfeiler-Leman算法,用于刻画C-MPNNs的表达能力。
- 通过分级模态逻辑变体定义C-MPNNs的逻辑表征,为其能力提供一种声明式形式化表达。
- 使用一个合成数据集(TRI-SQR),其中图对仅在全局结构上存在差异,以测试模型行为。
- 采用两种模型变体:一种带有全局求和读出,另一种不带,以隔离全局信息访问的影响。
- 将模型配置为四层,32个隐藏维度,学习率为1e-4,训练500个周期以评估性能。
实验结果
研究问题
- RQ1我们如何能在一个统一的理论框架下整合知识图谱中多样化的链接预测模型?
- RQ2条件消息传递神经网络在链接预测中的表达能力如何?其与现有图同构性测试的关系是什么?
- RQ3为何某些设计选择(如全局读出函数)能显著提升模型性能,且能否从形式上加以解释?
- RQ4NBFNets等模型的成功是否可归因于其表达能力?这种能力是否被更广泛的模型类别所涵盖?
- RQ5分级模态逻辑等逻辑形式化在多大程度上能够刻画C-MPNNs可计算函数的特性?
主要发现
- 带有全局求和读出的C-MPNNs在TRI-SQR数据集上达到100%准确率,能够正确识别三角形与正方形配置之间的图结构差异。
- 不带全局读出的C-MPNNs仅达到50%准确率,相当于随机猜测,原因在于其无法区分局部表示相同的图。
- C-MPNNs的表达能力与所提出的關係型Weisfeiler-Leman算法相当,为模型比较提供了理论基础。
- 该框架解释了NBFNets的强实证性能源于其高表达能力,而这种能力也存在于其他C-MPNN实例中。
- 全局读出函数对于捕捉全局图属性(如节点总数)至关重要,这些属性是区分原本不可区分图结构的必要条件。
- 通过分级模态逻辑的逻辑表征为C-MPNNs提供了形式化、声明式的对应物,使对其表征能力的精确分析成为可能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。