Skip to main content
QUICK REVIEW

[論文レビュー] Node Dependent Local Smoothing for Scalable Graph Learning

Wentao Zhang, Mingyu Yang|arXiv (Cornell University)|Oct 27, 2021
Advanced Graph Neural Networks参考文献 38被引用数 13
ひとこと要約

本稿では、ノード固有の局所構造と影響スコアに基づいて各ノードに独自のスムージング反復回数を割り当てるスケーラブルなグラフ学習手法であるノード依存局所スムージング(NDLS)を提案する。これにより、特徴量およびラベルのスムージングを適応的に行える。NDLSは、モデルの複雑さを増さずに、ノード分類タスクで最先端の性能を達成し、高い訓練効率とスケーラビリティを維持している。大規模グラフにおいて、APPNP や GAT よりも 1.0%–2.4% の精度向上を達成し、最大で 186× 速い訓練速度を実現した。

ABSTRACT

Recent works reveal that feature or label smoothing lies at the core of Graph Neural Networks (GNNs). Concretely, they show feature smoothing combined with simple linear regression achieves comparable performance with the carefully designed GNNs, and a simple MLP model with label smoothing of its prediction can outperform the vanilla GCN. Though an interesting finding, smoothing has not been well understood, especially regarding how to control the extent of smoothness. Intuitively, too small or too large smoothing iterations may cause under-smoothing or over-smoothing and can lead to sub-optimal performance. Moreover, the extent of smoothness is node-specific, depending on its degree and local structure. To this end, we propose a novel algorithm called node-dependent local smoothing (NDLS), which aims to control the smoothness of every node by setting a node-specific smoothing iteration. Specifically, NDLS computes influence scores based on the adjacency matrix and selects the iteration number by setting a threshold on the scores. Once selected, the iteration number can be applied to both feature smoothing and label smoothing. Experimental results demonstrate that NDLS enjoys high accuracy -- state-of-the-art performance on node classifications tasks, flexibility -- can be incorporated with any models, scalability and efficiency -- can support large scale graphs with fast training.

研究の動機と目的

  • 既存の GNN における固定されたスムージング反復回数の制限を解消し、ノード固有の構造的差を考慮しない問題に対処すること。
  • 局所的グラフ構造に基づいて、ノードごとに特徴量およびラベルスムージングの程度を適応的に制御する手法を開発すること。
  • モデルの複雑さを増さずに、大規模グラフ学習におけるモデルの性能、スケーラビリティ、効率性を向上させること。
  • グラフ構造の使用を前処理および後処理段階に分離することで、任意の下流モデルとの互換性を確保すること。

提案手法

  • NDLS は隣接行列に基づいて各ノードの影響スコアを計算し、他のノードがそのノードに与える影響の程度を定量化する。
  • 影響スコアが無限反復(過剰スムージング)スコアの ε 以内に達する最小の反復回数として、ノード固有の局所スムージング反復回数(LSI)を決定する。
  • LSI を用いて特徴量およびラベルスムージングの隣接領域半径を制限し、各ノードが関連する近隣ノードからのみ情報を集約することを保証する。
  • 特徴量スムージングは、NDLS-F を用いた前処理段階で実行され、その後、任意のモデル(例:MLP、SGC)でスムージングされた特徴量を用いて学習が行われる。
  • ラベルスムージングは、NDLS-L を用いた後処理段階で実行され、予測のロバスト性が向上する。
  • この手法により、モデル学習からグラフ構造の使用を分離し、独立したサンプルを持つ通常の機械学習問題にグラフ学習を変換する。

実験結果

リサーチクエスチョン

  • RQ1ノード固有の局所構造に適応するスムージング反復回数は、どのようにして実現可能か? これにより、不十分または過剰なスムージングを回避できるか?
  • RQ2ノード依存スムージングに基づくシンプルでスケーラブルな手法が、複雑な学習可能な GNN よりも精度と効率性で優れているか?
  • RQ3ノードのスパarsity(特徴量、エッジ、ラベル)の下で、NDLS は既存の線形モデルベースの GNN よりも優れているか?
  • RQ4ノード次数と最適なスムージング反復回数の関係は何か? これは理論的期待と一致するか?

主な発見

  • NDLS は全 7 データセットで最先端の性能を達成し、APPNP や GAT よりもそれぞれ 1.0%–1.9%、0.9%–2.4% のテスト精度向上を達成した。
  • ogbn-papers100M データセットでは、結合型 GNN より最大 39×、GAT より最大 186× 速い訓練速度を達成しながら高い精度を維持した。
  • NDLS はスパarsity に対して高いロバスト性を示した。特徴量、エッジ、ラベルのスパarsity のさまざまなレベルにおいて、ベースラインを著しく上回った。
  • LSI 値はノード次数と負の相関関係にあり、理論的期待と一致し、手法の設計の妥当性が裏付けられた。
  • 可視化結果から、密集した領域に位置するノードや高次数ノードの近くのノードは LSI が低く、局所的な接続性に基づいた適応的スムージングが行われていることが示された。
  • 特徴量やエッジが一部欠損している状況でも NDLS は高い性能を維持しており、データ不足下での強力な一般化能力を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。