Skip to main content
QUICK REVIEW

[论文解读] Data Augmentation for Graph Neural Networks

Tong Zhao, Yozen Liu|arXiv (Cornell University)|Jun 11, 2020
Advanced Graph Neural Networks被引用 9
一句话总结

本文提出GAug,一种图数据增强框架,通过利用神经边预测器来促进同类边、抑制异类边,从而提升图神经网络(GNN)在半监督节点分类任务中的性能。GAug-M在训练过程中修改图结构,GAug-O在推理时生成增强图,跨数据集和GNN架构实现最高达17%的F1绝对提升。

ABSTRACT

Data augmentation has been widely used to improve generalizability of machine learning models. However, comparatively little work studies data augmentation for graphs. This is largely due to the complex, non-Euclidean structure of graphs, which limits possible manipulation operations. Augmentation operations commonly used in vision and language have no analogs for graphs. Our work studies graph data augmentation for graph neural networks (GNNs) in the context of improving semi-supervised node-classification. We discuss practical and theoretical motivations, considerations and strategies for graph data augmentation. Our work shows that neural edge predictors can effectively encode class-homophilic structure to promote intra-class edges and demote inter-class edges in given graph structure, and our main contribution introduces the GAug graph data augmentation framework, which leverages these insights to improve performance in GNN-based node classification via edge prediction. Extensive experiments on multiple benchmarks show that augmentation via GAug improves performance across GNN architectures and datasets.

研究动机与目标

  • 解决由于图的非欧几里得、不规则结构导致的有效图数据增强技术缺乏的问题。
  • 克服现有方法(如DropEdge、AdaEdge和BGCN)因误差传播或随机边操作带来的局限性。
  • 提出一种系统性的图增强方法,通过去噪图结构并模拟真实变化,提升泛化能力。
  • 通过模块化、可训练的增强框架,在多种GNN架构和数据集上实现一致的性能提升。
  • 证明边预测模型可隐式学习类同质性倾向,从而通过战略性地添加或移除边来改善GNN中的消息传递。

提出的方法

  • 训练一个神经边预测器(如GAE),基于图结构和节点特征学习节点对之间边存在的可能性。
  • 利用边预测器识别并促进同类边(可能存在的边),同时抑制异类边(不太可能存在的边),以增强类同质性结构。
  • 实现GAug-M:在GNN训练前,通过添加高概率边和移除低概率边来修改输入图。
  • 实现GAug-O:在推理时使用边预测器生成多个增强图变体,而不修改原始图。
  • 将边预测模块作为可微分组件集成,联合优化节点分类和边预测损失。
  • 使用多任务损失函数,结合节点分类损失(交叉熵)和边预测损失(如BCE),使边预测与类同质性保持一致。

实验结果

研究问题

  • RQ1神经边预测器能否有效编码图中的类同质性结构,以指导有意义的数据增强?
  • RQ2基于预测边概率的战略性边添加与移除,如何改善GNN在节点分类任务中的泛化能力?
  • RQ3所提出的GAug框架是否在多种GNN架构和数据集上优于现有基线方法(如DropEdge、AdaEdge和BGCN)?
  • RQ4在弱监督设置下(标注数据稀疏),GAug的性能提升程度如何,特别是在标注样本有限时?
  • RQ5该框架是否可灵活应用于不同GNN架构,而无需修改网络结构?

主要发现

  • GAug-M在Cora数据集上实现最高17%的F1绝对提升,在PPI数据集上实现19.2%的提升,显著优于基线模型和原始GNN。
  • GAug-O在Cora上实现最高9%的F1绝对提升,在BlogCatalog上实现11.5%的提升,且在全部6个基准数据集上均表现出一致的性能增益。
  • GAug-M在所有数据集和架构上的平均性能优于DropEdge 4.1%、AdaEdge 4.8%、BGCN 9.3%。
  • GAug-O在所有数据集和架构上的平均性能优于DropEdge 2.0%、AdaEdge 2.7%、BGCN 4.9%,展现出良好的鲁棒性和泛化能力。
  • GAug-O中的边预测器学习到提高同类边比例、降低异类边比例,与理论预期的更优消息传递机制一致。
  • 在弱监督设置下(少量标注节点),GAug的性能可与使用更多标注数据的标准方法相媲美,展现出强大的样本效率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。