Skip to main content
QUICK REVIEW

[论文解读] GRPE: Relative Positional Encoding for Graph Transformer

Wonpyo Park, Woonggi Chang|arXiv (Cornell University)|Jan 30, 2022
Advanced Graph Neural Networks被引用 15
一句话总结

本文提出图相对位置编码(GRPE),一种新型的图变换器相对位置编码方法,可在不进行图线性化的情况下联合建模节点拓扑与节点-边相互作用。通过在注意力图和值表示中学习与节点特征相互作用的拓扑和边编码,GRPE在图分类、回归和节点分类基准上实现了最先进性能,包括在PCQM4Mv2上取得最先进结果,在ZINC和MolHIV上取得具有竞争力的结果。

ABSTRACT

We propose a novel positional encoding for learning graph on Transformer architecture. Existing approaches either linearize a graph to encode absolute position in the sequence of nodes, or encode relative position with another node using bias terms. The former loses preciseness of relative position from linearization, while the latter loses a tight integration of node-edge and node-topology interaction. To overcome the weakness of the previous approaches, our method encodes a graph without linearization and considers both node-topology and node-edge interaction. We name our method Graph Relative Positional Encoding dedicated to graph representation learning. Experiments conducted on various graph datasets show that the proposed method outperforms previous approaches significantly. Our code is publicly available at https://github.com/lenscloth/GRPE.

研究动机与目标

  • 为解决现有图位置编码方法的局限性,即要么对图进行线性化(导致拓扑精度损失),要么使用偏置项(导致特征编码集成不紧密)。
  • 开发一种位置编码方法,通过在图变换器中联合建模相对节点拓扑与节点-边关系,保留结构信息。
  • 实现在自注意力机制中直接整合图拓扑与边类型,从而增强表征学习能力。

提出的方法

  • 引入两个可学习的位置编码向量:用于捕捉相对拓扑距离(最多L跳最短路径)的拓扑编码 $\mathcal{P}$,以及用于建模不同边类型的边编码 $\mathcal{E}$。
  • 将拓扑和边编码嵌入注意力图与值计算中,实现在自注意力过程中节点特征与结构编码的交互。
  • 使用最大最短路径距离 $L$ 控制拓扑编码的感受野,实验中采用 $L=5$。
  • 通过与缩放点积注意力机制中的查询、键和值向量交互的可学习投影应用位置编码。
  • 在注意力机制中引入一个虚拟节点作为全局上下文,使深层网络能够关注整个图。
  • 支持共享与层特定编码,消融实验表明共享编码带来的性能增益极小,表明独立编码更为有效。

实验结果

研究问题

  • RQ1一种能联合建模节点拓扑与节点-边相互作用的相对位置编码方法,是否能在图变换器中超越绝对位置编码或基于偏置的相对编码方法?
  • RQ2将拓扑与边编码同时集成到注意力图与值表示中,对图表示学习任务的模型性能有何影响?
  • RQ3为捕捉拓扑编码中的结构信息,最优的最大最短路径距离 $L$ 是多少,以避免过拟合或冗余?
  • RQ4在所有变换器层之间共享拓扑与边编码是否会降低性能,若会,降低幅度如何?
  • RQ5GRPE的注意力机制在各层中如何演化?是否能在深层网络中实现全局图感知?

主要发现

  • 在PCQM4Mv2数据集上,大型GRPE模型取得了最佳验证MAE得分,证明其在最大规模分子性质预测基准上的最先进性能。
  • 在ZINC数据集上,GRPE-Small实现了0.093的测试MAE,显著优于无位置编码的基线Transformer(0.668)及消融变体。
  • 消融研究显示,结合拓扑与边编码可使MAE从0.267(仅拓扑)降至0.147(两者无值编码),并进一步降至0.093(加入图编码值后)。
  • 增加最大最短路径距离 $L$ 可提升AUC性能,直至 $L=4$,但进一步增至 $L=5$ 无额外增益,表明 $L=4$ 在泛化性方面为最优。
  • 在层间共享拓扑与边编码可略微改善MAE(从0.101降至0.094),但增加了参数量,表明独立编码更具效率。
  • 注意力图可视化结果证实,深层网络更关注虚拟节点,表明全局上下文逐步聚合,而浅层注意力则聚焦于邻居节点。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。