Skip to main content
QUICK REVIEW

[論文レビュー] Are More Layers Beneficial to Graph Transformers?

Haiteng Zhao, Shuming Ma|arXiv (Cornell University)|Mar 1, 2023
Advanced Graph Neural Networks被引用数 5
ひとこと要約

この論文は、深層グラフトランスフォーマーが重要な部分構造において徐々に注意力容量を失い、12層を超えると性能が低下することを特定した。これを解決するために、著者らは部分構造トークンと局所的自己注意機構を導入するDeepGraphを提案した。これにより、部分構造への注目を強化し、表現力も向上させ、48層にまで及ぶ深層アーキテクチャを用いて、グラフベンチマークで最先端の性能を達成した。

ABSTRACT

Despite that going deep has proven successful in many neural architectures, the existing graph transformers are relatively shallow. In this work, we explore whether more layers are beneficial to graph transformers, and find that current graph transformers suffer from the bottleneck of improving performance by increasing depth. Our further analysis reveals the reason is that deep graph transformers are limited by the vanishing capacity of global attention, restricting the graph transformer from focusing on the critical substructure and obtaining expressive features. To this end, we propose a novel graph transformer model named DeepGraph that explicitly employs substructure tokens in the encoded representation, and applies local attention on related nodes to obtain substructure based attention encoding. Our model enhances the ability of the global attention to focus on substructures and promotes the expressiveness of the representations, addressing the limitation of self-attention as the graph transformer deepens. Experiments show that our method unblocks the depth limitation of graph transformers and results in state-of-the-art performance across various graph benchmarks with deeper models.

研究の動機と目的

  • 自然言語処理やビジョン分野のトランスフォーマーと同様に、グラフトランスフォーマーの深さを増すことで性能が向上するかどうかを調査すること。
  • 特に部分構造における注意力容量の低下が原因で、12層を超えると性能が低下する理由を特定すること。
  • 深層アーキテクチャにおける重要な部分構造への注目能力と表現力の向上によって、そのボトルネックを解消すること。
  • モデルの深さが増すに従い、注意力容量と表現力の両方を維持できるスケーラブルで効果的な手法を設計すること。

提案手法

  • モデルの入力表現に、局所的なグラフ部分構造(例:環、クリーク)を明示的に表現するための専用の部分構造トークンを導入する。
  • 同じ部分構造に属するノードに対して局所的自己注意を適用し、局所的な構造的パターンに焦点を当てる。
  • 部分構造ベースの注意機構とグローバル自己注意を統合することで、長距離依存関係のモデリングを維持しながら、局所的特徴学習を強化する。
  • 非常に深いモデル(最大48層)の訓練を安定化させるために、deepnormリサルト接続を用いる。
  • 2段階の訓練戦略を採用:まず幾何的または近隣特徴を用いて部分構造トークンを事前学習し、その後エンドツーエンドで微調整する。
  • 注意力容量と表現ノルムを正規化することで、層をまたいで安定的かつ解釈可能な部分構造符号化を保証する。

実験結果

リサーチクエスチョン

  • RQ1グラフトランスフォーマーの深さを増すことで、グラフ学習タスクにおける性能が向上するのか?
  • RQ2現在のグラフトランスフォーマーはなぜ12層を超えると性能が向上しなくなるのか?
  • RQ3モデルの深さが増すに従い、部分構造における注意力容量はどのように減少するのか?
  • RQ4明示的な部分構造符号化と局所的注意機構を用いることで、深層グラフトランスフォーマーにおける注意力容量の回復と表現力の向上が可能になるのか?
  • RQ5提案手法は、より深いモデルを用いて標準的なグラフベンチマークで最先端の性能を達成できるのか?

主な発見

  • グラフトランスフォーマーは12層を超えると性能のボトルネックを示し、ZINCやCLUSTERでは48層モデルが浅いベースラインよりも性能が劣る。
  • 深さが増すに従い、部分構造における注意力容量が著しく低下し、重要な構造的パターンの学習と注目が困難になる。
  • DeepGraphは48層モデルを用いてZINC(テスト損失: 0.072)およびCLUSTER(正解率: 77.912)で最先端の性能を達成し、すべてのベースラインを上回った。
  • アブレーションスタディの結果、局所的注意(ZINCで約0.01の性能低下)と部分構造符号化(削除により顕著な低下)が深層モデル成功の鍵であることが確認された。
  • ノードレベルの注意よりも部分構造トークンがはるかに高い表現能力を示し、構造的情報を保持する役割を裏付けた。
  • モデルは部分構造の種別に対して頑健である:幾何的部分構造(例:環)は近隣に基づくものよりも重要であるが、両者を組み合わせることで最適な結果が得られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。