Skip to main content
QUICK REVIEW

[論文レビュー] Graph Masked Autoencoders with Transformers

Sixiao Zhang, Hongxu Chen|arXiv (Cornell University)|Feb 17, 2022
Advanced Graph Neural Networks被引用数 11
ひとこと要約

本稿では、マスク化機構と非対称エンコーダ・デコーダアーキテクチャを用いた自己教師付きトランスフォーマー基盤モデルであるGraph Masked Autoencoders (GMAE) を提案する。GMAEは、最大70%のノードをマスクし、それらの特徴を再構築することで、グラフ表現を効率的に学習する。この手法により、従来のトランスフォーマーと比較して最大20%のメモリ消費量削減を達成し、より大きなグラフやより深いモデルの学習を可能にするとともに、グラフ分類およびノード分類タスクで最先端の性能を達成する。

ABSTRACT

Recently, transformers have shown promising performance in learning graph representations. However, there are still some challenges when applying transformers to real-world scenarios due to the fact that deep transformers are hard to train from scratch and the quadratic memory consumption w.r.t. the number of nodes. In this paper, we propose Graph Masked Autoencoders (GMAEs), a self-supervised transformer-based model for learning graph representations. To address the above two challenges, we adopt the masking mechanism and the asymmetric encoder-decoder design. Specifically, GMAE takes partially masked graphs as input, and reconstructs the features of the masked nodes. The encoder and decoder are asymmetric, where the encoder is a deep transformer and the decoder is a shallow transformer. The masking mechanism and the asymmetric design make GMAE a memory-efficient model compared with conventional transformers. We show that, when serving as a conventional self-supervised graph representation model, GMAE achieves state-of-the-art performance on both the graph classification task and the node classification task under common downstream evaluation protocols. We also show that, compared with training in an end-to-end manner from scratch, we can achieve comparable performance after pre-training and fine-tuning using GMAE while simplifying the training process.

研究の動機と目的

  • 深層トランスフォーマーをグラフ上で学習する際の課題、特に高いメモリ消費量と、初期から学習を開始する難しさに対処すること。
  • GCNが深層アーキテクチャで過剰に平滑化(over-smoothing)を起こすという制限を超えて、グラフ表現学習におけるグローバル情報の捉え方を改善すること。
  • エンドツーエンド学習と同等の性能を維持しながら、微調整を簡素化する自己教師付き事前学習フレームワークを開発すること。
  • ノードマスキングと非対称設計により、グラフ設定におけるトランスフォーマーの2次関数的メモリ複雑度を低減すること。
  • 多様なグラフベンチマークデータセットに普遍的に適応する効果的なグラフトランスフォーマーの事前学習を可能にすること。

提案手法

  • GMAEは、大きな割合のノード(最大70%)をマスクし、マスクされたノードの元の特徴を再構築するマスクドオートエンコーディング目的を採用する。
  • 非対称アーキテクチャを用いる:マスクされたグラフを処理する深層12層トランスフォーマー・エンコーダと、マスクされたノード特徴を再構築する浅層2層トランスフォーマー・デコーダを採用する。
  • マスキング機構により、自己注意計算における実効的なノード数が減少し、70%のマスク比で、メモリ使用量がO(n²)からO(0.49n²)に低下する。
  • グラフデータにおける自己教師付き事前学習により、微調整の際の高い学習率と少ないエポック数での学習が可能になり、転移学習が可能になる。
  • モデルは、マスクされたノード特徴の再構築損失を用いて学習され、ノードレベルおよびグラフレベルの表現品質の両方を最適化する。
  • マスク比やデコーダの深さといったハイパーパrameterは、性能と効率のバランスを取るために経験的に調整される。

実験結果

リサーチクエスチョン

  • RQ1非対称トランスフォーマーを用いたマスクドオートエンコーディングアプローチは、性能を損なわせることなく、グラフ表現学習におけるメモリ消費量を削減できるか?
  • RQ2マスク比が、多様なグラフデータセットにおけるGMAEモデルの下流タスク性能にどのように影響を与えるか?
  • RQ3深層エンコーダと浅層デコーダを組み合わせることで、対称的トランスフォーマーと比較して性能と学習効率が向上するか?
  • RQ4GMAEの事前学習は、エンドツーエンド学習と同等の性能を達成できるか? また、学習プロセスを簡素化できるか?
  • RQ5GMAEは、Graphormerなどの最先端モデルと比較して、正確性およびメモリ効率の点で優れているか?

主な発見

  • GMAEは、標準的な自己教師付き評価プロトコルに従い、PROTEINS, BZR, COX2, ER_MD, NCI1, MUTAG, DHFRの7つのベンチマークグラフデータセットにおいて、グラフ分類およびノード分類タスクで最先端の性能を達成した。
  • 70%のマスク比を採用した場合、理論的計算量の最大50%の削減が可能であるにもかかわらず、従来のトランスフォーマーと比較して約20%のメモリ消費量削減を達成した。
  • マスク比が0.4または0.7付近で最も優れた性能を示し、ノードの半数をマスクした場合でも安定した性能を発揮することが示され、計算負荷が顕著に低減されることを裏付けた。
  • 1〜2層の浅いデコーダが、より深いデコーダよりも優れた性能を示し、非対称エンコーダ・デコーダ設計の効果性が性能と効率の両面で裏付けられた。
  • GMAEによる事前学習により、微調整に高い学習率と少ないエポック数が使用可能となり、エンドツーエンド学習と同等の性能を達成しながら、学習パイプラインの簡素化が可能となった。
  • 一部のベンチマークでは、高度に調整された学習スキームを必要としないまま、Graphormerを上回る性能を示した。これは、強力な汎化能力と使いやすさを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。