Skip to main content
QUICK REVIEW

[論文レビュー] GraphMixup: Improving Class-Imbalanced Node Classification on Graphs by Self-supervised Context Prediction

Lirong Wu, Haitao Lin|arXiv (Cornell University)|Jun 21, 2021
Advanced Graph Neural Networks参考文献 24被引用数 13
ひとこと要約

GraphMixupは、意味的特徴のミックスアップ、自己教師ありパス予測を用いた文脈に配慮したエッジミックスアップ、強化学習に基づく適応的アップサンプリングを統合したエンドツーエンドのフレームワークを提案する。これにより、さまざまな不均衡比を示す実世界のデータセットにおいて、最先端の性能を達成する。

ABSTRACT

Recent years have witnessed great success in handling node classification tasks with Graph Neural Networks (GNNs). However, most existing GNNs are based on the assumption that node samples for different classes are balanced, while for many real-world graphs, there exists the problem of class imbalance, i.e., some classes may have much fewer samples than others. In this case, directly training a GNN classifier with raw data would under-represent samples from those minority classes and result in sub-optimal performance. This paper presents GraphMixup, a novel mixup-based framework for improving class-imbalanced node classification on graphs. However, directly performing mixup in the input space or embedding space may produce out-of-domain samples due to the extreme sparsity of minority classes; hence we construct semantic relation spaces that allows the Feature Mixup to be performed at the semantic level. Moreover, we apply two context-based self-supervised techniques to capture both local and global information in the graph structure and then propose Edge Mixup specifically for graph data. Finally, we develop a \emph{Reinforcement Mixup} mechanism to adaptively determine how many samples are to be generated by mixup for those minority classes. Extensive experiments on three real-world datasets show that GraphMixup yields truly encouraging results for class-imbalanced node classification tasks.

研究の動機と目的

  • 少数クラスが不足しているためモデル性能が最適でないグラフニューラルネットワークにおけるクラス不均衡の課題に対処すること。
  • 特徴のスパarsityが少数クラスに及ぼす影響により、ドメイン外のサンプルが生成される可能性がある既存のミックスアップ手法の限界を克服すること。
  • 局所的およびグローバルな構造的情報を捉えることで、合成ノードのための現実的なエッジ生成を支援する自己教師ありフレームワークを開発すること。
  • ヒューリスティックなアップサンプリング比を、各少数クラスごとに最適化可能な学習可能な適応的メカニズムに置き換えること。
  • 手動でのハイパーパrameterチューニングに依存せずに、多様な不均衡比において一貫した性能向上を達成すること。

提案手法

  • 意味的関係空間を分離することで、意味的レベルでの特徴ミックスアップを実現し、スパースな少数クラスからのドメイン外サンプル生成を低減する。
  • 局所的構造的依存関係とグローバルな構造的依存関係を捉える2つの文脈に基づく自己教師ありタスク(局所パス予測とグローバルパス予測)を設計する。
  • これらの自己教師ありタスクを用いてエッジ予測器を訓練し、合成ノードと既存ノードの間の接続を予測することで、現実的なエッジミックスアップを可能にする。
  • 性能フィードバックに基づき、各少数クラスの最適なアップサンプリングスケールを動的に決定する強化学習エージェントを統合する。
  • 意味的特徴ミックスアップ、エッジミックスアップ、適応的アップサンプリングを統合したエンドツーエンドの訓練フレームワーク内で、共同最適化を実現する。
  • 相関分析による検証を経た、専用のSEMモジュールを備えたボトルネックエンコーダ(例:GCN、GAT、SAGE)を用いる。

実験結果

リサーチクエスチョン

  • RQ1スパース性が著しい少数クラスにおいて、意味的レベルでの特徴ミックスアップはドメイン外サンプルの生成を緩和できるか?
  • RQ2局所的およびグローバルな構造的情報を効果的に捉えるにはどうすればよいか? これにより、合成ノードのための現実的なエッジ予測を支援できるか?
  • RQ3ヒューリスティックまたは固定スケールアプローチに比べ、強化学習に基づく適応的アップサンプリング機構は、クラス不均衡なノード分類で優れた性能を発揮するか?
  • RQ4自己教師ありコンテキスト予測タスクは、不均衡なグラフデータにおけるモデルの汎化性能とロバスト性をどの程度向上させるか?
  • RQ5提案フレームワークは、広範な不均衡比の範囲において、常に既存の最先端手法を上回る性能を発揮できるか?

主な発見

  • GraphMixupは、Cora、PubMed、Redditの3つの実世界データセットにおいて、さまざまな不均衡比のもとで、すべてのデータセットで最高の性能を達成し、GraphSMOTE や SMOTE といったベースラインを上回った。
  • SEMボトルネックエンコーダとすべてのGraphMixupコンponentsを備えたバージョン(GraphMixup$_C$)は、CoraでF1-macroスコア0.942を達成し、次に優れた手法(GraphSMOTE)を0.012上回った。
  • 強化学習メカニズムは、初期値0.5から最適なアップサンプリングスケール0.8に収束し、固定スケールを用いたアブレーションスタディで観察された最良の性能と一致した。
  • アブレーションスタディの結果、局所パス予測とグローバルパス予測の両タスクが不可欠であり、併用することでROC-AUCスコアが最も高く、全体的な性能も最良となった。
  • 相関分析の結果、SEMモジュールが特徴相関マップに4つの明確な対角ブロックを生成しており、意味的特徴の有効な分離が確認された。
  • 強化学習メカニズムを削除した場合(GraphMixup-Fix)、アップサンプリングスケールが0.8を超えると性能が低下し、適応的スケーリングの必要性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。