Skip to main content
QUICK REVIEW

[論文レビュー] From Local Structures to Size Generalization in Graph Neural Networks

Gilad Yehudai, Ethan Fetaya|arXiv (Cornell University)|Oct 17, 2020
Advanced Graph Neural Networks参考文献 60被引用数 9
ひとこと要約

本稿では、グラフニューラルネットワーク(GNNs)が、学習とテストの分布におけるローカル構造(d-patternsによって測定)が異なる場合、小さなグラフから大きなグラフへ一般化できないことの原因を特定している。本稿は、意味のあるローカル構造表現を学ぶための新しい自己教師あり学習タスクを提案し、実データセット全体で平均して分類精度を4%向上させた。特に、構造的差異が大きい社会的・生物学的ネットワークにおいて顕著な向上が得られた。

ABSTRACT

Graph neural networks (GNNs) can process graphs of different sizes, but their ability to generalize across sizes, specifically from small to large graphs, is still not well understood. In this paper, we identify an important type of data where generalization from small to large graphs is challenging: graph distributions for which the local structure depends on the graph size. This effect occurs in multiple important graph learning domains, including social and biological networks. We first prove that when there is a difference between the local structures, GNNs are not guaranteed to generalize across sizes: there are "bad" global minima that do well on small graphs but fail on large graphs. We then study the size-generalization problem empirically and demonstrate that when there is a discrepancy in local structure, GNNs tend to converge to non-generalizing solutions. Finally, we suggest two approaches for improving size generalization, motivated by our findings. Notably, we propose a novel Self-Supervised Learning (SSL) task aimed at learning meaningful representations of local structures that appear in large graphs. Our SSL task improves classification accuracy on several popular datasets.

研究の動機と目的

  • GNNsが小さなグラフから大きなグラフへ一般化できない条件とその理由を理解すること。
  • ローカル構造がグラフサイズに依存するグラフ分布を特定し、一般化性能が低下する要因を同定すること。
  • d-pattern表現を学習することで、サイズ一般化を向上させる自己教師あり学習アプローチを提案すること。
  • 実世界のデータセットを用いた実験的検証を通じて、d-patternの不一致がGNNの一般化に与える影響を検証すること。

提案手法

  • 本稿では、dホップ近傍内のローカル構造を形式化するd-patternを導入し、ノード次数を一般化したものである。
  • 理論的に、学習集合とテスト集合の間でd-patternのわずかな不一致が、GNNの非一般化的グローバルミニマに収束することを証明している。
  • 大規模なグラフからd-patternの意味的な表現を学ぶための新しい自己教師ありプロキシタスクを提案している。
  • 本手法は、ラベル付きの小さなグラフで学習を行い、大規模なグラフに対して自己教師ありタスクを適用することで一般化性能を向上させる。
  • NCI1、DD、IMDB-Binary、および社会的ネットワークを含む実世界のデータセットを用いて評価している。
  • d-patternの分布の不一致を定量化するために、合計変動距離(total variation distance)が用いられている。

実験結果

リサーチクエスチョン

  • RQ1GNNsが小さなグラフから大きなグラフへ一般化できない条件は何か?
  • RQ2学習グラフとテストグラフの間でローカル構造(d-patterns)の不一致が、GNNの一般化性能にどのように影響するか?
  • RQ3d-pattern表現に焦点を当てた自己教師あり学習タスクは、GNNのサイズ一般化を向上させることができるか?
  • RQ4実世界のグラフデータセットにおいて、小さなグラフと大きなグラフの間でd-patternの不一致がどの程度顕在化しているか?
  • RQ5提案された自己教師あり手法は、大規模なグラフにおいて測定可能な性能向上をもたらすか?

主な発見

  • 理論的分析により、学習グラフとテストグラフの間でローカル構造(d-patterns)が異なる場合、GNNは一般化性能が著しく低いグローバルミニマに収束しうることが示された。
  • 実験的結果により、d-patternの不一致とGNNの一般化性能の間には強い負の相関関係があることが判明し、特に社会的・生物学的ネットワークで顕著であった。
  • IMDB-Binary、Deezer、Twitchなどのデータセットでは、d-pattern分布間の合計変動距離が高く(最大1.0に達し)、ローカル構造の重複がほぼないことを示している。
  • 提案された自己教師あり学習タスクにより、実データセット全体で平均して分類精度が4%向上した。特にd-patternの不一致が顕著なデータセットで大きな向上が得られた。
  • Twitch や Deezer などの社会的ネットワークでは、小さなグラフと大きなグラフのd-patternがほぼ不一致であるため、本手法の恩恵が顕著に現れた。
  • 一方、NCI1 や D& D のようなデータセットではd-patternの不一致が低く、自己教師ありタスクによる向上も最小限にとどまった。これは、不一致と性能向上の間の相関関係を裏付ける結果であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。