Skip to main content
QUICK REVIEW

[论文解读] On Positional and Structural Node Features for Graph Neural Networks on Non-attributed Graphs

Hejie Cui, Zijie Lu|arXiv (Cornell University)|Jul 3, 2021
Advanced Graph Neural Networks参考文献 52被引用 9
一句话总结

本文研究了在无属性图上图神经网络(GNNs)的人工节点特征,将它们分类为位置型和结构型。通过在10个基准数据集上进行大量实验,表明在位置节点分类任务中,位置特征表现更优;而在结构节点分类和图分类任务中,结构特征表现更佳,采用一种新型的度桶范围初始化方法,甚至在某些情况下超越了使用真实特征的模型,达到最先进性能。

ABSTRACT

Graph neural networks (GNNs) have been widely used in various graph-related problems such as node classification and graph classification, where superior performance is mainly established when natural node features are available. However, it is not well understood how GNNs work without natural node features, especially regarding the various ways to construct artificial ones. In this paper, we point out the two types of artificial node features, i.e., positional and structural node features, and provide insights on why each of them is more appropriate for certain tasks, i.e., positional node classification, structural node classification, and graph classification. Extensive experimental results on 10 benchmark datasets validate our insights, thus leading to a practical guideline on the choices between different artificial node features for GNNs on non-attributed graphs. The code is available at https://github.com/zjzijielu/gnn-positional-structural-node-features.

研究动机与目标

  • 理解人工节点特征如何影响无属性图上GNN的性能,其中自然节点特征缺失。
  • 基于其信息内容和实用性,将常见的人工节点特征分类为位置型和结构型。
  • 根据下游任务需求,提供实证洞察和选择合适人工节点特征的实用指南。
  • 在多个图挖掘任务和数据集上,评估各种初始化方法的性能。

提出的方法

  • 作者根据其编码的图信息,将人工节点特征分为两类:位置型(例如,基于位置的、DeepWalk)和结构型(例如,度、PageRank、特征值)。
  • 在10个基准数据集上,针对三种任务评估了八种常见初始化方法——随机、独热编码、度、PageRank、特征值、DeepWalk、共享和度桶范围——的性能。
  • 对于每项任务,使用图神经网络(特别是GraphSAGE)结合均值和求和聚合方法,并采用先前工作的标准协议以确保公平比较。
  • 提出一种新型基于度的初始化方法——“度桶范围”,通过将节点按度的范围分组,以更好地编码结构层次。
  • 实验涵盖三类任务:位置节点分类、结构节点分类和图分类,性能通过准确率衡量。
  • 研究在数据集间采用一致的评估框架,包括MUTAG、PROTEINS、IMDB-BINARY、IMDB-MULTI等,使用5折交叉验证并报告标准差。

实验结果

研究问题

  • RQ1在位置节点分类任务中,哪种人工节点特征——位置型还是结构型——表现更优?
  • RQ2不同的人工节点特征如何影响结构节点分类和图分类任务?
  • RQ3在某些场景下,精心设计的人工节点特征是否能超越使用真实节点特征的模型?
  • RQ4在使用人工特征时,聚合类型(均值与求和)在图分类中的相对贡献是什么?
  • RQ5新型的“度桶范围”初始化方法与现有方法相比,在性能和泛化能力方面表现如何?

主要发现

  • 度桶范围初始化方法在结构节点分类任务中达到最先进性能,优于标准度特征和其他基线方法。
  • 在图分类任务中,使用求和聚合的GNN模型在MUTAG上达到84.4%的准确率,在IMDB-BINARY上达到69.7%,超过了使用真实特征的模型(MUTAG上为71.4%)。
  • 在PROTEINS数据集上,PageRank结合求和聚合在IMDB-BINARY上达到70.3%的准确率,超过真实特征基线的67.8%。
  • 求和聚合在图分类任务中始终优于均值聚合,因为它能更好地保留邻域基数信息。
  • 结构节点特征,尤其是PageRank和基于度的方法,在所有图分类数据集上均持续优于位置特征。
  • 即使在缺乏自然节点特征的情况下,精心设计的人工特征仍可在特定设置下使GNN性能超越使用真实特征的模型。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。