Skip to main content
QUICK REVIEW

[论文解读] Counting Substructures with Higher-Order Graph Neural Networks: Possibility and Impossibility Results

Behrooz Tahmasebi, Lim, Derek|arXiv (Cornell University)|Dec 6, 2020
Advanced Graph Neural Networks参考文献 58被引用 6
一句话总结

本文提出递归邻域池化(RNP),一种新型图神经网络(GNN)架构,通过递归池化局部邻域表示来计数大小为 $k$ 的子结构,克服了标准消息传递GNN在子图计数方面的局限性。该方法证明,与现有高阶GNN相比,RNP在显著降低计算成本的前提下,能够计数任意大小为 $k$ 的子结构,同时建立了紧致的信息论下界和时间复杂度下界。

ABSTRACT

While message passing Graph Neural Networks (GNNs) have become increasingly popular architectures for learning with graphs, recent works have revealed important shortcomings in their expressive power. In response, several higher-order GNNs have been proposed that substantially increase the expressive power, albeit at a large computational cost. Motivated by this gap, we explore alternative strategies and lower bounds. In particular, we analyze a new recursive pooling technique of local neighborhoods that allows different tradeoffs of computational cost and expressive power. First, we prove that this model can count subgraphs of size $k$, and thereby overcomes a known limitation of low-order GNNs. Second, we show how recursive pooling can exploit sparsity to reduce the computational complexity compared to the existing higher-order GNNs. More generally, we provide a (near) matching information-theoretic lower bound for counting subgraphs with graph representations that pool over representations of derived (sub-)graphs. We also discuss lower bounds on time complexity.

研究动机与目标

  • 为解决消息传递GNN在计数子结构(尤其是含三个或以上顶点的诱导子图)方面的局限性。
  • 开发一种计算高效的替代方案,以应对现有高阶GNN因 $\Theta(n^k)$ 复杂度而计算成本过高的问题。
  • 分析基于池化的GNN在子图计数中表达能力与计算复杂度之间的权衡。
  • 为任何能够计数子结构的GNN架构建立信息论下界和时间复杂度下界。
  • 证明递归池化局部邻域可实现子图计数,而无需依赖节点标识符或完整的同构性检查。

提出的方法

  • 提出递归邻域池化(RNP),一种技术,通过在局部节点邻域上执行 $k$ 次递归池化操作,构建具有表达力的表示。
  • 使用多重集函数聚合源自局部邻域的子图表示,实现对结构模式的单射编码。
  • 在 $k$-元组节点上采用递归消息传递机制,每一层对来自更大子图的表示进行池化。
  • 在每一层递归中引入增强的特征表示以保留结构信息,并使用可学习的MLP进行变换。
  • 对节点表示进行求和池化,随后通过最终的MLP生成图级别的输出,用于下游任务。
  • 设计一种分层聚合策略,可适应图的稀疏性,相比完整的 $k$-元组GNN,显著降低计算成本。

实验结果

研究问题

  • RQ1能否通过在局部邻域上应用递归池化机制,使GNN架构在不依赖节点ID或完整同构性检查的前提下,计数所有大小为 $k$ 的子结构?
  • RQ2此类递归池化方法的计算复杂度是多少?与现有高阶GNN相比有何差异?
  • RQ3任何能够计数子结构的GNN的最小信息论下界和时间复杂度下界是什么?
  • RQ4输入图的稀疏性如何影响递归池化在子图计数中的效率?
  • RQ5所提出的RNP方法在必须编码的子图数量方面是否接近最优?

主要发现

  • RNP仅通过在局部邻域上进行 $k$ 次递归池化操作,即可计数任意大小为 $k$ 的诱导子图,克服了标准MPNN的根本性局限。
  • RNP的计算复杂度显著低于现有高阶GNN,其复杂度随相关子图数量增长,而非 $\Theta(n^k)$,尤其在图稀疏时优势明显。
  • 本文建立了接近匹配的信息论下界,表明为计数子结构必须编码的子图数量,证明RNP在编码效率上接近最优。
  • 推导出时间复杂度下界,表明任何具备子结构计数能力的GNN必须处理至少一定数量的子图表示,而RNP几乎完全达到该下界。
  • 在Erdős-Rényi图和随机正则图上的实证评估表明,RNP-GNN在子图计数任务中优于基线模型,且参数量和计算成本更低。
  • 该方法在EXP数据集上表现优异,能够区分1-WL等价但3-WL可区分的图,证明其表达能力超越标准MPNN。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。