[论文解读] Node Masking: Making Graph Neural Networks Generalize and Scale Better
本文提出节点掩码(Node Masking),一种简单而有效的正则化技术,通过在训练过程中随机掩码部分节点,提升图神经网络(GNNs)的泛化能力和可扩展性。通过增强关系归纳偏置并减少过拟合,节点掩码在 Cora、PubMed 和 Reddit 的半监督与归纳节点分类基准上均显著提升性能,相较于未使用缓存的 GIN 模型,F1 分数最高提升 3.5%。
Graph Neural Networks (GNNs) have received a lot of interest in the recent times. From the early spectral architectures that could only operate on undirected graphs per a transductive learning paradigm to the current state of the art spatial ones that can apply inductively to arbitrary graphs, GNNs have seen significant contributions from the research community. In this paper, we utilize some theoretical tools to better visualize the operations performed by state of the art spatial GNNs. We analyze the inner workings of these architectures and introduce a simple concept, Node Masking, that allows them to generalize and scale better. To empirically validate the concept, we perform several experiments on some widely-used datasets for node classification in both the transductive and inductive settings, hence laying down strong benchmarks for future research.
研究动机与目标
- 分析最先进空间 GNN 的内部工作机制,识别过平滑与过拟合的成因。
- 在半监督与归纳学习设置下,提升 GNN 的泛化能力与可扩展性。
- 提出并实证验证节点掩码作为一种正则化技术,可增强关系归纳偏置。
- 为未来 GNN 研究建立强大且可复现的多数据划分基准。
提出的方法
- 该方法在前向传播过程中随机掩码训练节点的子集,迫使 GNN 更依赖关系结构而非节点特诊。
- 该方法在节点层面应用类似 Dropout 的正则化,与特征或消息层面的掩码不同,以提升泛化能力。
- 利用理论工具可视化 GNN 的操作过程,揭示过平滑与过拟合如何由聚合动态引发。
- 该方法应用于 GIN 及其他基于聚合的 GNN,性能在半监督与归纳设置下均进行评估。
- 通过重用一跳邻居表示来减少计算成本,使用缓存机制,且节点掩码在启用缓存时仍能保持或提升性能。
- 实验对比了在多个数据划分和模型规模下,启用与不启用节点掩码的模型,以评估其鲁棒性与可扩展性。
实验结果
研究问题
- RQ1在最先进的基于聚合的 GNN 中,过平滑与过拟合如何产生?其背后的机制是什么?
- RQ2像节点掩码这样简单且可学习的正则化技术,是否能在半监督与归纳 GNN 设置下提升泛化能力?
- RQ3当在大规模图中结合缓存机制时,节点掩码在多大程度上提升了可扩展性?
- RQ4在减少推理中涉及的唯一节点数量时,特别是在归纳设置下,节点掩码是否能保持或提升性能?
主要发现
- 在归纳设置下,节点掩码将 GIN 在 Cora 上的 F1 分数最高提升 3.93%,在 PubMed 和 Reddit 上的提升均达到 3.5% 或以上。
- 在 Cora 上,当训练集大小为 90% 时,GIN+NodeMasking 达到 83.95% 的 F1 分数,优于未使用缓存的 GIN(83.07%)和使用缓存的 GIN(82.50%)。
- 在 PubMed 上,当训练集大小为 75% 时,节点掩码将 F1 分数从 GIN 的 85.46% 提升至 GIN+NM 的 86.59%,且 p 值显著小于 0.05。
- GIN 与 GIN+NodeMasking 的 MAD(最大激活距离)值几乎相同(例如,在 Cora 上使用 10% 训练集时为 0.65),表明节点掩码未损害模型的表达能力。
- 节点掩码减少了过拟合,附录中的损失曲线显示训练动态更平稳,且在不同数据划分下泛化能力更优。
- 在启用缓存的情况下,GIN+NodeMasking 的性能保持不变或优于未使用缓存的 GIN,表明该技术在不牺牲准确率的前提下增强了可扩展性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。