[论文解读] From Local Structures to Size Generalization in Graph Neural Networks
该论文指出,当训练集与测试集的局部结构(通过 d-patterns 衡量)不同时,图神经网络(GNNs)在从小图泛化到大图时表现不佳。为此,论文提出了一项新颖的自监督学习任务,以学习有意义的局部结构表征,平均在真实数据集上将分类准确率提升 4%,尤其在具有高结构差异性的社交网络和生物网络中效果显著。
Graph neural networks (GNNs) can process graphs of different sizes, but their ability to generalize across sizes, specifically from small to large graphs, is still not well understood. In this paper, we identify an important type of data where generalization from small to large graphs is challenging: graph distributions for which the local structure depends on the graph size. This effect occurs in multiple important graph learning domains, including social and biological networks. We first prove that when there is a difference between the local structures, GNNs are not guaranteed to generalize across sizes: there are "bad" global minima that do well on small graphs but fail on large graphs. We then study the size-generalization problem empirically and demonstrate that when there is a discrepancy in local structure, GNNs tend to converge to non-generalizing solutions. Finally, we suggest two approaches for improving size generalization, motivated by our findings. Notably, we propose a novel Self-Supervised Learning (SSL) task aimed at learning meaningful representations of local structures that appear in large graphs. Our SSL task improves classification accuracy on several popular datasets.
研究动机与目标
- 理解GNNs在何时以及为何从小图泛化到大图时失败。
- 识别局部结构依赖于图大小的图分布,从而导致泛化性能差。
- 提出一种自监督学习方法,通过学习 d-pattern 表征来改善大小泛化能力。
- 通过实证方法验证 d-pattern 差异对真实世界数据集中 GNN 泛化能力的影响。
提出的方法
- 论文将 d-patterns 作为 d-跳邻域内局部结构的形式化表示,推广了节点度的概念。
- 理论上证明,即使训练集与测试集之间 d-pattern 的差异很小,也可能导致 GNN 收敛到无法泛化的全局最小值。
- 提出了一项新颖的自监督掩蔽任务,用于从大图中学习 d-pattern 的有意义表征。
- 该方法在有标签的小图上进行训练,并在大图上应用自监督任务以提升泛化能力。
- 该方法在包括 NCI1、DD、IMDB-Binary 和社交网络在内的真实世界数据集上进行了评估。
- 使用总变差距离来量化小图与大图之间 d-pattern 分布的差异。
实验结果
研究问题
- RQ1在何种条件下,GNNs 会从小图泛化到大图时失败?
- RQ2训练图与测试图之间局部结构(d-patterns)的差异如何影响 GNN 的泛化能力?
- RQ3一项专注于 d-pattern 表征的自监督学习任务能否改善 GNN 的大小泛化能力?
- RQ4现实世界图数据集中,小图与大图之间的 d-pattern 差异在多大程度上存在?
- RQ5所提出的自监督方法是否能在大图上带来可测量的性能提升?
主要发现
- 理论分析表明,当训练图与测试图的局部结构(d-patterns)不同时,GNN 可能收敛到泛化能力差的全局最小值。
- 实证结果表明,d-pattern 差异与 GNN 泛化性能之间存在强烈负相关性,尤其在社交网络和生物网络中表现明显。
- 在 IMDB-Binary、Deezer 和 Twitch 等数据集中,d-pattern 分布之间的总变差距离较高(高达 1.0),表明局部结构几乎无重叠。
- 所提出的自监督学习任务在真实数据集上平均将分类准确率提升 4%,在 d-pattern 差异较大的数据集中提升更显著。
- 该方法在社交网络(如 Twitch 和 Deezer)中表现尤为突出,因为这些网络中小图与大图的 d-pattern 几乎完全不相交。
- 相比之下,NCI1 和 D& D 数据集的 d-pattern 差异较低,自监督任务带来的性能提升微乎其微,进一步证实了差异程度与性能增益之间的关联。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。