[论文解读] Large-scale graph representation learning with very deep GNNs and self-supervision
本文提出了一种高度可扩展的图神经网络(GNN)方法,用于大规模图表示学习,采用极深的网络架构(最多50层)并结合通过自举(bootstrapping)和去噪(denoising)目标实现的自监督学习。该方法在MAG240M和PCQM4M两个基准测试中均取得了前三名的成绩,证明了在大规模场景下深度GNN与自监督学习的有效性。
Effectively and efficiently deploying graph neural networks (GNNs) at scale remains one of the most challenging aspects of graph representation learning. Many powerful solutions have only ever been validated on comparatively small datasets, often with counter-intuitive outcomes -- a barrier which has been broken by the Open Graph Benchmark Large-Scale Challenge (OGB-LSC). We entered the OGB-LSC with two large-scale GNNs: a deep transductive node classifier powered by bootstrapping, and a very deep (up to 50-layer) inductive graph regressor regularised by denoising objectives. Our models achieved an award-level (top-3) performance on both the MAG240M and PCQM4M benchmarks. In doing so, we demonstrate evidence of scalable self-supervised graph representation learning, and utility of very deep GNNs -- both very important open issues. Our code is publicly available at: https://github.com/deepmind/deepmind-research/tree/master/ogb_lsc.
研究动机与目标
- 研究极深GNN(最多50层)在大规模图数据集上的可扩展性与性能表现。
- 评估自监督学习目标(如自举和去噪)在大规模图表示学习中的影响。
- 确定表达能力强的深度GNN是否在真实世界的大规模图基准测试中优于浅层或简单模型。
- 探索辅助训练目标(如BGRL和Noisy Nodes)在提升泛化能力和深度可扩展性方面的效用。
- 验证自监督学习是否能够在大规模图上实现更长训练周期而不产生过拟合。
提出的方法
- 作者为MAG240M开发了一种深度归纳式节点分类器,利用自举方法迭代优化未标记节点的预测结果。
- 在PCQM4M上,他们使用基于消息传递的GNN架构和基于Conformer的分子特征,训练了一个50层的归纳式图回归器。
- 应用BGRL(Bootstrap GNN Representation Learning)目标,通过视图增强和对比学习,促进鲁棒且不变的表示学习。
- 使用Noisy Nodes正则化器,在消息传递过程中向节点特征注入噪声,以稳定极深GNN的训练过程。
- 通过模型集成和细致的后处理,减小测试集上的分布偏移,提升泛化能力。
- 模型在数十亿条边和数百万个节点上进行训练,利用自监督目标引入未标记数据。
实验结果
研究问题
- RQ1与浅层模型相比,极深GNN(最多50层)是否能在大规模图基准测试中实现更优性能?
- RQ2自监督学习,特别是通过自举和去噪方法,是否能显著提升大规模图上的泛化能力和训练稳定性?
- RQ3在极大规模图的背景下,现代对比自监督方法(如BGRL)的有效性如何?
- RQ4辅助目标(如Noisy Nodes)在多大程度上能实现随着深度增加而单调提升的性能?
- RQ5自监督学习是否能使大规模数据集上的训练时间显著延长而不产生过拟合?
主要发现
- 最终模型在MAG240M上的测试准确率达到75.19%,在OGB-LSC基准中位列前三。
- 在PCQM4M上,模型的测试平均绝对误差(MAE)为0.1205,同样位列前三。
- 利用未标记节点进行自监督学习,随着未标记数据量的增加,性能持续且单调提升。
- 由于自监督的正则化作用,训练时间可延长10倍而不会出现过拟合。
- Noisy Nodes正则化器对实现深度增加下的单调性能提升至关重要;若移除该正则化器,性能将退化至远浅于当前深度的模型水平。
- 更宽的消息传递函数(1,024个隐藏维度)优于具有更大潜在维度(256)的模型,表明在大规模场景下架构超参数具有高度敏感性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。