[论文解读] Pre-training Graph Neural Networks with Kernels
本文提出了一种面向图神经网络(GNNs)的任务无关预训练方法,该方法利用孪生网络学习与当前最先进的图核(如Weisfeiler-Lehman(WL)核)对齐的表征。该方法通过核诱导的表征学习提升GNN性能,在多个图基准数据集上均取得一致的性能增益,包括在MUTAG数据集上实现3.27%的准确率提升,以及在PTC数据集上实现2.69%的增益,优于标准DGCNN训练方法。
Many machine learning techniques have been proposed in the last few years to process data represented in graph-structured form. Graphs can be used to model several scenarios, from molecules and materials to RNA secondary structures. Several kernel functions have been defined on graphs that coupled with kernelized learning algorithms, have shown state-of-the-art performances on many tasks. Recently, several definitions of Neural Networks for Graph (GNNs) have been proposed, but their accuracy is not yet satisfying. In this paper, we propose a task-independent pre-training methodology that allows a GNN to learn the representation induced by state-of-the-art graph kernels. Then, the supervised learning phase will fine-tune this representation for the task at hand. The proposed technique is agnostic on the adopted GNN architecture and kernel function, and shows consistent improvements in the predictive performance of GNNs in our preliminary experimental results.
研究动机与目标
- 解决尽管图核方法取得进展,GNN在图分类任务中性能仍有限的问题。
- 开发一种利用成熟图核归纳偏差的预训练技术,以提升GNN的泛化能力。
- 通过在微调前学习核诱导表征,使GNN能够从无标签图数据中获益。
- 构建一种核无关、架构无关的预训练框架,适用于任意GNN和图核。
提出的方法
- 训练一个孪生GNN架构,使用固定图核(如WL、PK、RW)作为目标,预测图对之间的核相似度。
- 在预训练阶段使用均方误差损失,以最小化预测值与真实核值之间的差异。
- 在下游分类任务的微调前,使用学习到的孪生网络权重初始化GNN。
- 采用两阶段训练流程:在无标签图上进行无监督预训练,随后在有标签数据上进行有监督微调。
- 以DGCNN作为基础GNN架构,1D卷积和全连接层使用ReLU激活函数,图卷积层使用tanh激活函数。
- 预训练阶段使用Adam优化器和均方误差损失,微调阶段使用负对数似然损失。
实验结果
研究问题
- RQ1通过孪生网络预训练GNN以近似图核,能否提升下游分类性能?
- RQ2核诱导表征学习是否能在不同GNN架构和图数据集上泛化?
- RQ3与随机初始化相比,使用次优核(如h=2的WL核)进行预训练对GNN性能有何影响?
- RQ4在大规模数据集(如NCI1)上,预训练能否缩小图核与GNN之间的性能差距?
主要发现
- 在MUTAG上,预训练的DGCNN达到88.10% ± 1.05的准确率,优于标准DGCNN的85.83% ± 1.66,提升2.27个百分点。
- 在PTC上,预训练模型达到61.03% ± 2.86,较DGCNN的58.59%提升2.44个百分点。
- 在NCI1上,预训练DGCNN达到77.13% ± 0.45,优于DGCNN的74.44%,但仍落后于WL核的84.46%。
- 即使用于预训练的核(h=2的WL核)并非最佳性能核(如PTC上PK核表现更优),该方法仍优于随机初始化。
- 预训练阶段在有限训练轮次(NCI1仅2轮)下仍有效,表明对训练时长约束具有鲁棒性。
- 结果表明,使用单一核进行预训练有益,但使用多个核可能进一步缩小与纯核方法的性能差距。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。