Skip to main content
QUICK REVIEW

[論文レビュー] Characterizing Graph Datasets for Node Classification: Homophily-Heterophily Dichotomy and Beyond

Oleg Platonov, Denis Kuznedelev|arXiv (Cornell University)|Sep 13, 2022
Advanced Graph Neural Networks被引用数 5
ひとこと要約

本稿では、ノード分類のためのグラフデータセットを特徴付けるための改善された指標として、調整済み同質性(adjusted homophily)とラベルの情報量(LI)を提案する。一般的に用いられる同質性測定値は、一貫性のないベースラインのため、欠陥を抱えていることが示され、調整済み同質性は望ましい理論的性質を満たす。LIは、隣接ノードのラベルがノードのラベルをどの程度予測できるかを定量化するものであり、特に異質性の高いグラフにおいて、同質性よりもGNNの性能をよりよく予測する。これは、GNNがこうしたデータセットでしばしば成功する理由を説明する。

ABSTRACT

Homophily is a graph property describing the tendency of edges to connect similar nodes; the opposite is called heterophily. It is often believed that heterophilous graphs are challenging for standard message-passing graph neural networks (GNNs), and much effort has been put into developing efficient methods for this setting. However, there is no universally agreed-upon measure of homophily in the literature. In this work, we show that commonly used homophily measures have critical drawbacks preventing the comparison of homophily levels across different datasets. For this, we formalize desirable properties for a proper homophily measure and verify which measures satisfy which properties. In particular, we show that a measure that we call adjusted homophily satisfies more desirable properties than other popular homophily measures while being rarely used in graph machine learning literature. Then, we go beyond the homophily-heterophily dichotomy and propose a new characteristic that allows one to further distinguish different sorts of heterophily. The proposed label informativeness (LI) characterizes how much information a neighbor's label provides about a node's label. We prove that this measure satisfies important desirable properties. We also observe empirically that LI better agrees with GNN performance compared to homophily measures, which confirms that it is a useful characteristic of the graph structure.

研究の動機と目的

  • 一般的に用いられる同質性測定値に内在する深刻な欠陥を特定し、異なるデータセット間での信頼できる比較を妨げる要因を明らかにすること。
  • 堅牢な同質性測定値に望ましいとされる性質、特に一定のベースライン性質を形式化すること。
  • 従来の同質性測定値の代替として理論的に妥当な調整済み同質性を提案すること。
  • 同質性–異質性の二分法を超えて、異質性の異なるタイプを区別できる新たな指標としてラベルの情報量(LI)を導入すること。
  • LIが多様なデータセットにおいて、同質性測定値よりもGNN性能をより強く相関させることを実証的に検証すること。

提案手法

  • 同質性測定値に望ましいとされる性質(特に一定のベースライン性質を含む)のセットを形式化し、データセット間での公平性と比較可能性を保証すること。
  • 標準的な同質性測定値よりもより多くの性質を満たす測定値として、調整済み同質性(アッセートリビティ係数としても知られる)を定義すること。
  • ノードのラベルを予測するのに隣接ノードのラベルがどの程度有用かを定量化する新たな指標としてラベルの情報量(LI)を提案すること。
  • 理論的分析と実証的評価を併用して、LIが一定のベースライン性質を満たし、データセット間で比較可能であることを示すこと。
  • GCN、GraphSAGE、GAT、GTなどのGNNを用いて、合成データ(SBM、LFR)および実世界データ(Cora、Citeseer、その他のデータ)に対してLIと同質性測定値を評価すること。
  • GNN性能(ROC AUC)と各指標との間のスピアマン順位相関を計算し、予測力の評価を行うこと。

実験結果

リサーチクエスチョン

  • RQ1なぜ一般的に用いられる同質性測定値が、異なるグラフデータセット間での同質性レベルの信頼できる比較を妨げるのか?
  • RQ2どの同質性測定値が、特に一定のベースライン性質を含めて、最も望ましい理論的性質を満たすのか?
  • RQ3同質性–異質性の二分法を超えた新たな指標が、異質性の高いグラフにおけるGNN性能をよりよく説明できるか?
  • RQ4ラベルの情報量(LI)は、多様なデータセットにおいて同質性測定値と比較して、GNN性能の予測にどの程度優れているか?
  • RQ5なぜGNNはしばしば非常に異質性の高いグラフでも強力な性能を発揮するのか?そしてLIはこの現象を説明できるか?

主な発見

  • エッジ同質性やノード同質性といった一般的に用いられる同質性測定値は、一定のベースライン性質を満たさず、データセット間での比較が信頼できない。
  • 調整済み同質性は、他の同質性測定値よりも望ましい理論的性質をより多く満たしており、同質性を測定するための優れた代替手段とされるべきである。
  • ラベルの情報量(LI)は、隣接ノードのラベルがノードのラベルをどの程度予測できるかを定量化する新たな指標であり、一定のベースライン性質を満たしている。
  • LFRベンチマークの合成実験では、LIはGraphSAGE性能と0.99のスピアマン相関を示し、同質性測定値(例:h_adj 0.68)を著しく上回った。
  • 実世界のデータセットでは、LIがGNN性能と最も高いスピアマン相関を示した(GATでは0.85、GraphSAGEでは0.82)、同質性測定値をすべて上回った。
  • 先行研究で観察されたGNN性能とエッジ同質性のU字型の関係は、LIによって説明可能である。LIも同様にU字型のカーブを示し、同質性レベルにかかわらず隣接ノードのラベルが情報量が多い場合に高い性能を示すことを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。