Skip to main content
QUICK REVIEW

[論文レビュー] New Benchmarks for Learning on Non-Homophilous Graphs

Derek Lim, Xiuyu Li|arXiv (Cornell University)|Apr 3, 2021
Advanced Graph Neural Networks参考文献 58被引用数 25
ひとこと要約

本論文は、より大規模で多様な非同質的グラフデータセットと新しい同質度測度を導入し、単純なベースラインと非同質的GNNをベンチマークして、非同質性設定の洞察を明らかにする。

ABSTRACT

Much data with graph structures satisfy the principle of homophily, meaning that connected nodes tend to be similar with respect to a specific attribute. As such, ubiquitous datasets for graph machine learning tasks have generally been highly homophilous, rewarding methods that leverage homophily as an inductive bias. Recent work has pointed out this particular focus, as new non-homophilous datasets have been introduced and graph representation learning models better suited for low-homophily settings have been developed. However, these datasets are small and poorly suited to truly testing the effectiveness of new methods in non-homophilous settings. We present a series of improved graph datasets with node label relationships that do not satisfy the homophily principle. Along with this, we introduce a new measure of the presence or absence of homophily that is better suited than existing measures in different regimes. We benchmark a range of simple methods and graph neural networks across our proposed datasets, drawing new insights for further research. Data and codes can be found at https://github.com/CUAI/Non-Homophily-Benchmarks.

研究の動機と目的

  • 小規模で合成的なデータセットを超えた、より良い非同質的グラフベンチマークの必要性を動機付ける。
  • 文脈やラベル-トポロジーの関係が多様な、より大規模な実世界の非同質的データセットを提案する。
  • クラス不均衡とサイズ効果を緩和する頑健な同質度測度を導入する。
  • 提案データセット上で、強力な単純手法を再導入し、さまざまなGNNとベースラインを評価する。
  • 低同質性領域における手法の性能とスケーラビリティに関する洞察を提供する。

提案手法

  • クラスサイズを制御しつつ、クラス別近傍類似性を集約する新しい同質度測度 hat{h} を提案する。
  • 適用可能なノード特徴量を含む、ドメインを横断するいくつかの大規模な実世界の非同質データセットを組み立てる(例:ソーシャルネットワーク、生物学、時系列/引用データ)。
  • MLP、ラベル伝播(1ホップおよび2ホップ)、LINK、SGC、C&S、一般的なGNN(GCN、GAT、APPNP、JK系)、および非同質的GNN(H2GCN、MixHop、GPR-GNN)など、広範な手法をベンチマークする。
  • 標準的な精度またはROC-AUCを使用して、5つの固定の訓練/検証/テストスプリットで評価する(ogbn-proteinsはOpen Graph Benchmarkのスプリットを使用)。
  • 大規模データセットに非同質的手法を適用する際のメモリ制約とスケーラビリティについて議論する。

実験結果

リサーチクエスチョン

  • RQ1既存の非同質的学習法は、より大規模で実世界の非同質グラフでどのように性能を発揮するか。
  • RQ2ノード特徴量とトポロジーベースのベースラインの単純な組み合わせは、多様なデータセット全体で、専用の非同質GNNと競合するか、それを上回るか。
  • RQ3新しく提案された同質度測度 hat{h} は、従来のエッジ同質性やデータセット間のモデル性能とどのように関連するか。
  • RQ4非同質グラフ学習手法のスケーラビリティと性能のトレードオフはどうなるか。
  • RQ5データセット全体で、シンプルな2ホップ変種は非同質設定で性能を向上させることができるか。

主な発見

  • ノード特徴量またはグラフトポロジーのいずれかを用いるシンプルなベースラインは、提案データセット全体でランダムよりも良い性能を示す。
  • 非同質的GNNは概して良好な性能を示すが普遍的ではなく、2ホップ変種はしばしば利益を提供する。
  • 従来の低ランク/低パス仮定(同質性駆動モデルの一部に見られる)は、非同質設定では成り立たず、特定の単純なGNNの効果を低下させる。
  • LINK、ノード特徴を使用しなくても、トポロジーベースのベースラインであるLINKは多くのデータセットで良好な性能を示す。
  • メモリとスケーラビリティの課題がいくつかの手法で明らかになる大規模な非同質データセットを検討する。スケーラビリティと性能のトレードオフを強調する。
  • 新しい hat{h} 測度はクラス不均衡の影響を緩和し、多様なデータセット全体で同質性の存在をよりよく捉える。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。