Skip to main content
QUICK REVIEW

[論文レビュー] Sparse Graph Attention Networks

Ye Yang, Shihao Ji|arXiv (Cornell University)|Dec 2, 2019
Advanced Graph Neural Networks参考文献 26被引用数 6
ひとこと要約

本稿では、L₀ノルム正則化を用いてスパースな注意係数を学習することで、グラフからノイジーまたは関係のないエッジを同定・削除するスパース・グラフ注意ネットワーク(SGAT)を提案する。すべての層とヘッドで1つの注意係数を共有することで、SGATは不均一なグラフにおいて性能を向上させ、均一なグラフでは精度を維持しながらエッジの50%〜80%を削除する。

ABSTRACT

Graph Neural Networks (GNNs) have proved to be an effective representation learning framework for graph-structured data, and have achieved state-of-the-art performance on many practical predictive tasks, such as node classification, link prediction and graph classification. Among the variants of GNNs, Graph Attention Networks (GATs) learn to assign dense attention coefficients over all neighbors of a node for feature aggregation, and improve the performance of many graph learning tasks. However, real-world graphs are often very large and noisy, and GATs are prone to overfitting if not regularized properly. Even worse, the local aggregation mechanism of GATs may fail on disassortative graphs, where nodes within local neighborhood provide more noise than useful information for feature aggregation. In this paper, we propose Sparse Graph Attention Networks (SGATs) that learn sparse attention coefficients under an $L_0$-norm regularization, and the learned sparse attentions are then used for all GNN layers, resulting in an edge-sparsified graph. By doing so, we can identify noisy/task-irrelevant edges, and thus perform feature aggregation on most informative neighbors. Extensive experiments on synthetic and real-world graph learning benchmarks demonstrate the superior performance of SGATs. In particular, SGATs can remove about 50\%-80\% edges from large assortative graphs, while retaining similar classification accuracies. On disassortative graphs, SGATs prune majority of noisy edges and outperform GATs in classification accuracies by significant margins. Furthermore, the removed edges can be interpreted intuitively and quantitatively. To the best of our knowledge, this is the first graph learning algorithm that shows significant redundancies in graphs and edge-sparsified graphs can achieve similar or sometimes higher predictive performances than original graphs.

研究の動機と目的

  • 大規模でノイジーな現実世界のグラフにおいて、グラフ注意ネットワーク(GAT)の過学習およびノイズ感受性を緩和すること。
  • GATにおける複数の注意ヘッドが非常に類似した注意分布を生成するという冗長性を低減すること。
  • タスクに不要なエッジやノイジーなエッジを自動的に同定・削除できるグラフ学習手法を開発すること。
  • 局所的集約が近隣ノイズのため失敗する不均一なグラフにおける性能を向上させること。
  • エッジをスパース化したグラフが、元のグラフと同等またはより良い性能を達成できることを示すこと。

提案手法

  • すべてのGNN層におけるエッジ選択のスパarsityを促進するために、注意係数にL₀ノルム正則化を適用する。
  • すべての注意ヘッドおよびすべての層で1つの注意係数を共有することで、GATアーキテクチャを単純化する。
  • エッジごとに1つの注意重みを学習し、ネットワーク全体でそれを再利用することで、冗長性を低減する。
  • L₀ノルムの微分可能近似としてコクリートリラクセーションを用い、エンドツーエンドの学習を可能にする。
  • スパarsity誘導型ハイパーパrameter λ を用いて、確率的勾配降下法でモデルを最適化する。
  • スパースな注意メカニズムを、情報のある近隣ノードでのみ特徴集約を実行するGNNフレームワークに統合する。

実験結果

リサーチクエスチョン

  • RQ1L₀ノルム正則化は、グラフ構造データにおけるノイジーまたは関係のないエッジを効果的に同定・削除できるか?
  • RQ2すべてのヘッドおよび層で1つの共有注意係数を学習することで、標準的なGATと比較して一般化性能が向上し、過学習が軽減されるか?
  • RQ3エッジスパース化されたグラフは、均一および不均一なグラフの両方で分類精度を維持または向上できるか?
  • RQ4スパarsityレベル(λ で制御)は、モデル性能およびエッジ削除率にどのように影響するか?
  • RQ5GAT、GCN、GraphSAGEと比較して、局所的集約が有害な不均一なグラフにおいて、SGATは性能を上回れるか?

主な発見

  • SGATは、Texas や Cora のような不均一なグラフにおいて、GATと同等または高い分類精度を達成し、近隣ノイズに対して高いロバスト性を示した。
  • PPI や Reddit のような均一なグラフでは、SGATがエッジの50%〜80%を削除しながら、同等の分類精度を維持した。
  • 最適な正則化パラメータ λ は、PPI では 2e-6、Texas では 5e-3 であった。これはスパarsityと性能のバランスを取るのに適していた。
  • PPI および Texas における注意ヘッド数 K=2 が最良の性能を示し、K の増加は過学習リスクを高めることを示した。
  • t-SNE 視覚化により、ノイジーな不均一なグラフ(Texas など)において、SGATはGATよりもより分類可能な表現を学習した。
  • 多数のエッジを削除したにもかかわらず、特徴の保存に占める主要なメモリコストのため、SGATはGATと比較して実行時間やメモリ使用量に顕著な改善を示さなかった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。