Skip to main content
QUICK REVIEW

[论文解读] SPAGAN: Shortest Path Graph Attention Network

Yiding Yang, Xinchao Wang|arXiv (Cornell University)|Jan 10, 2021
Advanced Graph Neural Networks参考文献 24被引用 11
一句话总结

SPAGAN 提出了一种新型图注意力网络,用基于最短路径的注意力机制替代传统的基于节点的注意力机制,通过单层即可捕捉全局图拓扑结构。通过从中心节点计算到高阶邻居的最短路径,并在这些路径上应用可学习的注意力机制,SPAGAN 在节点分类基准上实现了最先进性能,显著提升了特征聚合能力与收敛稳定性。

ABSTRACT

Graph convolutional networks (GCN) have recently demonstrated their potential in analyzing non-grid structure data that can be represented as graphs. The core idea is to encode the local topology of a graph, via convolutions, into the feature of a center node. In this paper, we propose a novel GCN model, which we term as Shortest Path Graph Attention Network (SPAGAN). Unlike conventional GCN models that carry out node-based attentions within each layer, the proposed SPAGAN conducts path-based attention that explicitly accounts for the influence of a sequence of nodes yielding the minimum cost, or shortest path, between the center node and its higher-order neighbors. SPAGAN therefore allows for a more informative and intact exploration of the graph structure and further {a} more effective aggregation of information from distant neighbors into the center node, as compared to node-based GCN methods. We test SPAGAN on the downstream classification task on several standard datasets, and achieve performances superior to the state of the art. Code is publicly available at https://github.com/ihollywhy/SPAGAN.

研究动机与目标

  • 为解决传统 GCN 和 GAT 模型依赖堆叠多层来传递信息至远距离邻居所导致的性能下降与收敛困难问题。
  • 通过利用最短路径,在单层内实现对高阶邻居的有效且稳定的特征聚合。
  • 通过显式探索节点之间的最小成本路径,而非依赖逐层邻域传播,更稳健地建模全局图结构。
  • 通过路径注意力机制捕捉更具信息量的结构上下文,从而提升基准图数据集上的节点分类准确率。

提出的方法

  • SPAGAN 使用 Dijkstra 算法计算从中心节点到其高阶邻居的所有不同长度的最短路径,形成路径矩阵 𝒫。
  • 从 𝒫 中提取每条路径的特征,并应用路径到节点的注意力机制,基于路径特征与节点表示计算注意力系数。
  • 通过可微分的路径注意力层,迭代更新节点嵌入与路径注意力系数,实现端到端训练。
  • 引入分层路径注意力机制,使模型能够对不同长度的路径学习注意力权重,从而增强特征聚合能力。
  • 采用稀疏张量运算在 GPU 上高效计算路径注意力,即使在路径扩展的情况下仍保持较低内存开销。
  • 通过最小化交叉熵损失进行端到端训练,每次迭代均使用更新后的注意力系数重新生成路径矩阵。

实验结果

研究问题

  • RQ1与传统 GCN 中基于节点的注意力机制相比,使用最短路径的路径注意力机制是否能提升节点表示学习效果?
  • RQ2在节点分类任务中,仅使用最短路径的单层图网络是否优于深层堆叠的 GCN 模型?
  • RQ3对不同长度路径的分层注意力机制如何影响模型性能与泛化能力?
  • RQ4关键超参数——路径采样率、最大路径深度与迭代次数——对模型收敛与准确率的影响如何?

主要发现

  • SPAGAN 在节点分类任务上达到最先进性能,在 Cora 数据集上准确率达 83.6%,优于 GAT(83.0%)与 SPAGAN_Fix(83.2%)。
  • 在 Citeseer 数据集上,SPAGAN 达到 73.0% 的准确率,超过 GAT(72.5%)与 SPAGAN_Fix(72.4%)。
  • 在 PubMed 数据集上,SPAGAN 准确率达 79.6%,优于 GAT(79.0%)与 SPAGAN_Fix(79.2%)。
  • 消融实验表明,分层路径注意力机制显著提升性能,SPAGAN 在所有数据集上均优于 SPAGAN_Fix。
  • 敏感性分析显示,采样比率为 1.0(即使用每个节点的所有路径)时性能最佳,且两次迭代已足够实现收敛。
  • 模型保持极低内存开销——在 PubMed 上仅增加约 200MB GPU 内存,适用于大规模稀疏图。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。