Skip to main content
QUICK REVIEW

[論文レビュー] Explainability in Graph Neural Networks: An Experimental Survey

Peibo Li, Yixing Yang|arXiv (Cornell University)|Mar 17, 2022
Explainable Artificial Intelligence (XAI)被引用数 16
ひとこと要約

本稿では、グラフニューラルネットワーク(GNN)の説明可能性手法に関する包括的な実験的調査を提示し、人間の関与を要しない評価指標「説明信頼度」を提案することで、実世界のデータセットを用いた手法の客観的ベンチマークを実現している。実験の結果、GraphMASKは、層ごとの重要度をモデル化できるため、GNNExplainer や PGExplainer よりも優れていることが判明した。特に、高信頼度レベルにおいて顕著な性能向上が見られた。一方、GNNExplainer は、GCNII などの深層モデルでは性能が著しく低下する傾向にあった。

ABSTRACT

Graph neural networks (GNNs) have been extensively developed for graph representation learning in various application domains. However, similar to all other neural networks models, GNNs suffer from the black-box problem as people cannot understand the mechanism underlying them. To solve this problem, several GNN explainability methods have been proposed to explain the decisions made by GNNs. In this survey, we give an overview of the state-of-the-art GNN explainability methods and how they are evaluated. Furthermore, we propose a new evaluation metric and conduct thorough experiments to compare GNN explainability methods on real world datasets. We also suggest future directions for GNN explainability.

研究の動機と目的

  • 実世界のデータセットにおけるGNNの説明可能性手法に対する包括的かつ客観的な評価の不足を解消すること。
  • 人間によるラベル付き真値に依存しない、定量的かつスケーラブルな比較を可能にする「説明信頼度」という人間不要の評価指標を提案すること。
  • 実世界の引用ネットワークを用いて、最先端のGNN説明可能性手法(GNNExplainer, PGExplainer, GraphMASK)を、さまざまなGNNアーキテクチャ(GCN, GAT, GCNII)で評価すること。
  • 特に、浅層モデル(GCN, GAT)と深層モデル(GCNII)の間で、説明可能性手法の性能がどのように変化するかを調査すること。
  • 現在の説明可能性手法の限界を明らかにし、GNNの説明可能性分野における今後の研究方向性を示唆すること。

提案手法

  • 説明のスパarsityを、さまざまな信頼度レベルで測定できる新しい評価指標「説明信頼度」を提案し、人間の関与なしに客観的な比較を可能にする。
  • 多段階の評価戦略を採用:各モデルとデータセットに対して、信頼度レベル 0.50 から 0.95 の範囲で説明のスパarsityを計算し、その平均値を算出する。
  • ベンチマーク用のデータセットとして、Cora, Citeseer, Pubmed の3つの実世界の引用ネットワークを用いる。
  • GCN, GAT, GCNII のモデルを、層数を変化させ(2層からGCNIIでは最大64層まで)、テストセット上の予測を説明するため、GNNExplainer, PGExplainer, GraphMASK を適用する。
  • GraphMASK および PGExplainer に対して、単一インスタンス学習とモデルレベル学習の両方を適用し、学習戦略の説明品質への影響を評価する。
  • 標準的な忠実度(fidelity)および逆忠実度(inverse fidelity)の指標を用いて妥当性の検証を行うが、主なベンチマークとして新しい「説明信頼度」指標を強調する。

実験結果

リサーチクエスチョン

  • RQ1合成データや小分子データにとどまらず、多様な実世界のデータセットにおいて、既存のGNN説明可能性手法はどの程度の性能を示すのか?
  • RQ2特に浅層モデル(GCN, GAT)と深層モデル(GCNII)の間で、GNN説明可能性手法の性能はどのように変化するのか?
  • RQ3人間不要の評価指標を用いることで、GNN説明可能性手法をスケーラブルかつ客観的に比較することが可能になるか?
  • RQ4GNNExplainer らのような現在の説明可能性手法は、パrameter数が多くなる深層GNNに適用した場合、どのような限界を示すのか?
  • RQ5単一インスタンス学習とモデルレベル学習の異なる学習戦略が、GraphMASK や PGExplainer が生成する説明の品質にどのように影響するのか?

主な発見

  • GraphMASK は、すべてのデータセットおよびGNNアーキテクチャにおいて、GNNExplainer や PGExplainer を常に上回る性能を示した。特に、高信頼度レベル(例:0.90–0.95)において顕著な優位性が確認され、より忠実で安定した説明が得られていることが示された。
  • GNNExplainer は、GCNII などの深層モデルに適用した場合、顕著な性能低下を示した。これは、アーキテクチャの複雑さに対してスケーラビリティと耐性に欠ける可能性を示唆している。
  • PGExplainer は浅層モデル(GCN, GAT)では性能が低かったが、GCNII では向上した。これは、モデルの深さやアーキテクチャに敏感である可能性を示している。
  • 提案された「説明信頼度」指標により、人間によるラベル付き真値がなくても、データセットやモデル間で信頼性があり、スケーラブルかつ客観的な比較が可能になった。
  • 単一インスタンスレベルの学習は、モデルレベルの学習よりも GraphMASK において優れた性能を示した。一方、PGExplainer については、両方の学習戦略で性能に大きな差がなかった。
  • 忠実度および逆忠実度の指標は、GraphMASK の優位性を確認したが、GNNExplainer は Cora における GAT では忠実度が高く、Pubmed における GCNII では逆忠実度が優れており、指標ごとの一貫性の欠如が浮き彫りになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。