Skip to main content
QUICK REVIEW

[论文解读] Data Augmentation on Graphs: A Technical Survey

Jiajun Zhou, Chenxuan Xie|arXiv (Cornell University)|Dec 20, 2022
Advanced Graph Neural Networks被引用 8
一句话总结

本综述对图数据增强(GDAug)技术提供了全面的技术综述,按细粒度图元素——特征、节点、边、子图、图和标签层级进行分类。它形式化了定义,详述了技术机制,评估了性能指标,并概述了图表示学习中的应用与未来挑战。

ABSTRACT

In recent years, graph representation learning has achieved remarkable success while suffering from low-quality data problems. As a mature technology to improve data quality in computer vision, data augmentation has also attracted increasing attention in graph domain. To advance research in this emerging direction, this survey provides a comprehensive review and summary of existing graph data augmentation (GDAug) techniques. Specifically, this survey first provides an overview of various feasible taxonomies and categorizes existing GDAug studies based on multi-scale graph elements. Subsequently, for each type of GDAug technique, this survey formalizes standardized technical definition, discuss the technical details, and provide schematic illustration. The survey also reviews domain-specific graph data augmentation techniques, including those for heterogeneous graphs, temporal graphs, spatio-temporal graphs, and hypergraphs. In addition, this survey provides a summary of available evaluation metrics and design guidelines for graph data augmentation. Lastly, it outlines the applications of GDAug at both the data and model levels, discusses open issues in the field, and looks forward to future directions. The latest advances in GDAug are summarized in GitHub.

研究动机与目标

  • 为解决图数据增强(GDAug)研究中缺乏系统性分类体系和通用定义的问题。
  • 基于细粒度图元素(如特征、节点、边、子图、图和标签)建立统一的GDAug方法分类框架。
  • 开发一个全面的评估体系,包含性能与设计指标,用于评估增强质量与泛化能力。
  • 总结GDAug在各类图学习任务和复杂图类型中的数据级与模型级应用。
  • 识别开放问题并提出GDAug的未来研究方向,尤其针对复杂图与稳健评估框架。

提出的方法

  • 基于图元素提出六类GDAug分类体系:特征级、节点级、边级、子图级、图级和标签级增强。
  • 为每类GDAug形式化通用定义,详述技术机制,如特征掩码、边丢弃(例如DropEdge)、自适应边重连(例如AdaEdge)以及节点特征扰动(例如GRAND)。
  • 引入多指标评估体系,结合下游任务性能、一致性与多样性指标,以评估增强质量与泛化能力。
  • 回顾GDAug在自监督学习(如GraphCL、GCC、EGI)、对抗鲁棒性(如FLAG、GROC)以及通过子图采样实现的迁移学习中的应用。
  • 分析现有GDAug技术在异构图、动态图和知识图等复杂图类型中的适用性。
  • 提出一个GitHub仓库(https://github.com/jjzhou012/GDAug-Survey)以追踪该领域的最新进展。

实验结果

研究问题

  • RQ1如何基于细粒度图元素对图数据增强技术进行系统性分类?
  • RQ2不同GDAug方法在各图元素层级的核心技术机制与设计原则是什么?
  • RQ3如何建立一个超越下游任务准确率的全面且可解释的GDAug评估体系?
  • RQ4GDAug在提升图表示学习中模型鲁棒性、可迁移性与泛化能力方面的关键应用有哪些?
  • RQ5在异构图或动态图等复杂图类型中应用GDAug的主要开放挑战是什么?

主要发现

  • GDAug技术显著提升了模型鲁棒性,GraphCL与GROC通过生成增强视图,表现出对对抗攻击的更强抵抗能力。
  • 子图级增强方法如GCC与EGI通过随机游走与邻域网络采样,有效支持预训练与迁移学习。
  • 自适应边重连(如AdaEdge)与特征掩码(如FLAG)通过迭代优化图拓扑与特征表示,增强了模型泛化能力。
  • 当前评估实践高度依赖下游任务性能,但一致性与多样性指标正作为评估增强质量的补充工具逐步兴起。
  • 现有大多数GDAug方法仍局限于同质属性图,针对异构图、时空图与知识图等复杂图类型的处理仍存在显著研究空白。
  • 系统性评估框架仍不完善,现有指标常将预测性能与其他指标混合,缺乏足够的可解释性与灵活性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。