[论文解读] Can Graph Neural Networks Go "Online"? An Analysis of Pretraining and Inference
本文评估了图神经网络(GNNs)在微调预训练模型与从零开始重新训练之间,对预训练后插入未见节点和边的动态图的适应能力。结果表明,预训练GNNs在更少的推理轮次内实现了显著更高且更稳定的测试准确率,证明了预训练在现实世界应用中在线动态图学习中的关键作用。
Large-scale graph data in real-world applications is often not static but dynamic, i. e., new nodes and edges appear over time. Current graph convolution approaches are promising, especially, when all the graph's nodes and edges are available during training. When unseen nodes and edges are inserted after training, it is not yet evaluated whether up-training or re-training from scratch is preferable. We construct an experimental setup, in which we insert previously unseen nodes and edges after training and conduct a limited amount of inference epochs. In this setup, we compare adapting pretrained graph neural networks against retraining from scratch. Our results show that pretrained models yield high accuracy scores on the unseen nodes and that pretraining is preferable over retraining from scratch. Our experiments represent a first step to evaluate and develop truly online variants of graph neural networks.
研究动机与目标
- 探究在训练后引入新节点和边时,预训练是否能提升图神经网络的性能,以模拟现实世界的动态图。
- 通过对比预训练模型微调与从零开始重新训练,评估GNNs在图更新后进行在线推理的可行性。
- 评估GNNs在不同归纳设置下(未见数据的标签率高与低)的鲁棒性和泛化能力。
- 建立可复现的实验框架,用于评估图神经网络的在线学习能力。
- 提供实证证据,证明预训练能提升动态图场景下的性能与稳定性,尤其是在推理更新有限的情况下。
提出的方法
- 构建了两阶段实验设置:首先在图的标记子集上预训练GNNs;其次插入此前未见的节点和边,并执行有限次推理轮次。
- 使用三个引文网络数据集——Cora、Citeseer和Pubmed,划分为两种互补的归纳设置:'few-many'(低标签率)和'many-few'(高标签率)。
- 应用三种GNN架构:GCN、GAT和GraphSAGE,以及一个MLP基线模型,所有模型均使用Adam优化器和标准超参数进行训练。
- 在每次推理轮次后,评估未见节点子集上的测试准确率,对比有预训练与无预训练模型(共200轮)。
- 使用Jensen-Shannon散度定量比较两种训练-测试设置下准确率分布的相似性。
- 共执行60组实验,每组重复100次,以减少随机方差并确保统计可靠性。
实验结果
研究问题
- RQ1在训练后引入新节点和边时,预训练是否能提升图神经网络的性能?
- RQ2在在线推理过程中,预训练GNNs与从零开始重新训练相比,在准确率和收敛速度方面表现如何?
- RQ3预训练的优势在不同归纳设置下是否一致——特别是当标签率高与低时?
- RQ4预训练GNNs在添加未见节点和边时,其方差和收敛性表现是否稳定且鲁棒?
- RQ5在预训练后仅进行有限次推理轮次,是否能实现未见节点的高准确率,从而表明其在在线图学习中的实际可行性?
主要发现
- 在所有数据集和架构中,预训练GNNs在测试准确率上始终优于非预训练模型,且在100次运行中方差更低。
- 预训练模型的测试准确率在仅5–10次推理轮次后即趋于稳定,表明其在未见数据上收敛迅速。
- 在'few-many'与'many-few'设置下,准确率分布的Jensen-Shannon散度在有预训练时(0.0057–0.0115)显著低于无预训练时(0.0666–0.1013),表明性能在不同设置间更一致。
- GAT在无预训练时初始学习速度最快,但预训练模型仍实现了更高的绝对准确率和稳定性。
- 即使MLP结构更简单且未针对图结构设计,预训练GNNs的准确率仍显著高于MLP基线。
- 在Cora、Citeseer和Pubmed三个数据集中,预训练与非预训练模型之间的性能差距保持一致,证实了研究发现的泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。