Skip to main content
QUICK REVIEW

[論文レビュー] Data Augmentation for Graph Neural Networks

Tong Zhao, Yozen Liu|arXiv (Cornell University)|Jun 11, 2020
Advanced Graph Neural Networks被引用数 9
ひとこと要約

本稿では、グラフの非ユークリッド的・不規則的な構造に起因するデータ拡張手法の不足を解消するため、クラス内同質性(class-homophilic)構造を学習することで、半教師ありノード分類におけるグラフニューラルネットワーク(GNN)の性能を向上させるGAugというグラフデータ拡張フレームワークを提案する。GAug-Mは学習中にグラフを変更し、GAug-Oは推論時に拡張を生成する。複数のデータセットおよびGNNアーキテクチャにおいて、最大17%のF1スコア向上を達成した。

ABSTRACT

Data augmentation has been widely used to improve generalizability of machine learning models. However, comparatively little work studies data augmentation for graphs. This is largely due to the complex, non-Euclidean structure of graphs, which limits possible manipulation operations. Augmentation operations commonly used in vision and language have no analogs for graphs. Our work studies graph data augmentation for graph neural networks (GNNs) in the context of improving semi-supervised node-classification. We discuss practical and theoretical motivations, considerations and strategies for graph data augmentation. Our work shows that neural edge predictors can effectively encode class-homophilic structure to promote intra-class edges and demote inter-class edges in given graph structure, and our main contribution introduces the GAug graph data augmentation framework, which leverages these insights to improve performance in GNN-based node classification via edge prediction. Extensive experiments on multiple benchmarks show that augmentation via GAug improves performance across GNN architectures and datasets.

研究の動機と目的

  • グラフの非ユークリッド的・不規則的構造に起因する、有効なデータ拡張手法の不足に対処すること。
  • DropEdge や AdaEdge、BGCN といった従来手法が誤差伝搬やランダムなエッジ操作に起因する限界を克服すること。
  • ノイズ除去によるグラフ構造の洗練と現実的な変化の再現を通じて一般化性能を向上させる、原理的かつ整合的なグラフ拡張アプローチの開発。
  • モジュラーで学習可能な拡張フレームワークとして、多様なGNNアーキテクチャおよびデータセットにおいて一貫した性能向上を実現すること。
  • エッジ予測モデルが暗黙的にクラス内同質性の傾向を学習できることを示し、GNNのメッセージスリングを改善する戦略的エッジ追加・削除を可能にすること。

提案手法

  • グラフ構造とノード特徴に基づいて、ノードペア間のエッジ存在確率を学習するためのニューラルエッジ予測器(例:GAE)を訓練する。
  • エッジ予測器を用いて、存在可能性が高いと予測されるクラス内エッジ(内的同質性エッジ)を促進し、存在可能性が低いと予測されるクラス間エッジ(外的同質性エッジ)を抑制することで、クラス内同質性構造を強化する。
  • GAug-Mを実装:GNNの学習前に、高確率のエッジを追加し、低確率のエッジを削除することで、入力グラフを変更する。
  • GAug-Oを実装:元のグラフを変更せずに、推論時にエッジ予測器を用いて複数の拡張グラフバージョンを生成する。
  • エッジ予測モジュールを微分可能コンponentとして統合し、ノード分類とエッジ予測損失の両方を同時に最適化する。
  • ノード分類損失(交差エントロピー)とエッジ予測損失(例:BCE)を組み合わせたマルチタスク損失を用い、エッジ予測をクラス同質性に一致させる。

実験結果

リサーチクエスチョン

  • RQ1ニューラルエッジ予測器は、グラフにおけるクラス内同質性構造を効果的にエンコードし、意味的なデータ拡張を導くことができるか?
  • RQ2予測されたエッジ確率に従って戦略的なエッジ追加・削除がなされると、ノード分類におけるGNNの一般化性能がどのように向上するか?
  • RQ3提案されたGAugフレームワークは、DropEdge や AdaEdge、BGCN といった既存の拡張ベースラインを、多様なGNNアーキテクチャおよびデータセットにおいて上回るか?
  • RQ4ラベル付きデータが限られる弱教師あり設定下で、GAugはどの程度性能を向上させるか?
  • RQ5GAugフレームワークは、アーキテクチャの変更なしに、さまざまなGNNアーキテクチャに柔軟に適用可能か?

主な発見

  • GAug-MはCoraで最大17%、PPIで19.2%のF1スコア向上を達成し、ヴァナイルGNNやベースラインを著しく上回った。
  • GAug-OはCoraで最大9%、BlogCatalogで11.5%のF1スコア向上を達成し、全6つのベンチマークデータセットで一貫した向上を示した。
  • GAug-Mは、DropEdgeに対して平均4.1%、AdaEdgeに対して4.8%、BGCNに対して9.3%の向上を示した。
  • GAug-Oは、DropEdgeに対して平均2.0%、AdaEdgeに対して2.7%、BGCNに対して4.9%の向上を示し、ロバストネスと一般化性能が優れていることを示した。
  • GAug-Oのエッジ予測器は、クラス内エッジの比率を増加させ、クラス間エッジの比率を減少させることを学習しており、メッセージスリングの向上という理論的期待と整合的である。
  • 弱教師あり(ラベル付きノードが少ない)条件下でも、GAugはラベル付きデータがより多い標準的手法と同等の性能を達成し、優れたサンプル効率を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。