Skip to main content
QUICK REVIEW

[论文解读] Self-supervised Learning on Graphs: Contrastive, Generative,or Predictive

Lirong Wu, Haitao Lin|arXiv (Cornell University)|May 16, 2021
Advanced Graph Neural Networks被引用 13
一句话总结

本综述全面回顾了图数据的自监督学习(SSL)方法,将其分类为对比学习、生成式和预测性方法。该工作提供了一个统一的数学框架,对标准数据集上的方法进行了基准测试,并提供了开源实现,显著提升了图SSL研究中的方法清晰度与可复现性。

ABSTRACT

Deep learning on graphs has recently achieved remarkable success on a variety of tasks, while such success relies heavily on the massive and carefully labeled data. However, precise annotations are generally very expensive and time-consuming. To address this problem, self-supervised learning (SSL) is emerging as a new paradigm for extracting informative knowledge through well-designed pretext tasks without relying on manual labels. In this survey, we extend the concept of SSL, which first emerged in the fields of computer vision and natural language processing, to present a timely and comprehensive review of existing SSL techniques for graph data. Specifically, we divide existing graph SSL methods into three categories: contrastive, generative, and predictive. More importantly, unlike other surveys that only provide a high-level description of published research, we present an additional mathematical summary of existing works in a unified framework. Furthermore, to facilitate methodological development and empirical comparisons, we also summarize the commonly used datasets, evaluation metrics, downstream tasks, open-source implementations, and experimental study of various algorithms. Finally, we discuss the technical challenges and potential future directions for improving graph self-supervised learning. Latest advances in graph SSL are summarized in a GitHub repository https://github.com/LirongWu/awesome-graph-self-supervised-learning.

研究动机与目标

  • 通过推进自监督学习(SSL)技术,解决图表示学习中标签数据成本高且稀缺的问题。
  • 将已在计算机视觉和自然语言处理领域取得成功的SSL方法拓展至图领域,利用图结构和特征丰富的数据带来的独特机遇。
  • 提供一个统一的数学框架,阐明不同图SSL方法的核心原理。
  • 使用标准数据集、评估指标和开源实现,整理并比较现有方法,以确保可复现性。
  • 识别对齐预训练任务与下游任务目标的关键挑战,并提出未来研究方向,以提升泛化能力。

提出的方法

  • 将图SSL方法划分为三种范式:对比学习(通过数据增强学习不变表示)、生成式学习(重建图结构或特征)和预测性学习(自动生成标签用于预测任务)。
  • 提出统一的数学表达式,以形式化表达图上对比学习、生成式学习和预测性学习的核心学习目标。
  • 采用数据增强策略(如节点掩码、边丢弃和特征扰动)生成对比学习中的正样本对。
  • 在生成式SSL中应用基于重建的预训练任务,即模型从损坏的视图中学习重建原始图结构或节点特征。
  • 设计基于启发式方法或专家知识(如中心性得分、元路径模式)的预测性预训练任务,以生成用于下游迁移的伪标签。
  • 使用Cora、PubMed、IMDB-B和MUTAG等常见数据集,在8个节点分类和7个图分类基准上实现标准化评估。

实验结果

研究问题

  • RQ1如何系统性地对不同图表示学习范式中的自监督学习方法进行分类与统一?
  • RQ2对比学习、生成式学习和预测性学习图SSL方法的核心数学原理是什么?如何在统一框架中表达?
  • RQ3不同图SSL方法在标准基准上的节点分类和图分类准确率表现如何?
  • RQ4哪些数据增强策略和预训练任务设计在图SSL中能最有效地提升泛化能力?
  • RQ5在对齐预训练任务目标与下游任务目标方面,仍存在哪些技术挑战,以增强模型的可迁移性?

主要发现

  • 对比学习方法如GRACE和BGRL在节点分类任务中达到最先进性能,其中GRACE在Coauthor-Physics数据集上达到95.26%的准确率。
  • 生成式方法如Graph-BERT和GCA表现优异,其中GCA在Coauthor-Physics上达到95.75%的准确率,在Amazon-Computers上达到93.10%。
  • 预测性方法如SelfGNN和KS2L表现具有竞争力,其中SelfGNN在Coauthor-Physics上达到95.50%的准确率,KS2L在Coauthor-Physics上达到95.56%。
  • MVGRL方法在Coauthor-Physics上达到95.33%的准确率,在Amazon-Computers上达到93.21%,展现出在多个数据集上的强大性能。
  • SUGAR在MUTAG上达到96.74%的准确率,优于其他方法,凸显了先进生成式与对比学习设计的潜力。
  • 综述识别出预训练任务目标与下游任务目标之间存在持续存在的差距,限制了泛化能力,呼吁未来设计中加强目标对齐。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。