Skip to main content
QUICK REVIEW

[論文レビュー] BAGEL: A Benchmark for Assessing Graph Neural Network Explanations

Mandeep Rathee, Thorben Funke|arXiv (Cornell University)|Jun 28, 2022
Machine Learning in Materials Science被引用数 6
ひとこと要約

本稿では、忠実性、スパarsity、正しさ、妥当性の4つの評価軸に基づいて、グラフニューラルネットワーク(GNN)の説明を評価する包括的なベンチマーク、BAGELを紹介する。この研究は、多様なメトリクス、データセット、説明手法を統合したモジュラーなフレームワークを提供し、どの手法も全メトリクスで一貫して優れているわけではないことが明らかになった。これは、GNNの解釈可能性研究において、多面的な評価の必要性を示している。

ABSTRACT

The problem of interpreting the decisions of machine learning is a well-researched and important. We are interested in a specific type of machine learning model that deals with graph data called graph neural networks. Evaluating interpretability approaches for graph neural networks (GNN) specifically are known to be challenging due to the lack of a commonly accepted benchmark. Given a GNN model, several interpretability approaches exist to explain GNN models with diverse (sometimes conflicting) evaluation methodologies. In this paper, we propose a benchmark for evaluating the explainability approaches for GNNs called Bagel. In Bagel, we firstly propose four diverse GNN explanation evaluation regimes -- 1) faithfulness, 2) sparsity, 3) correctness. and 4) plausibility. We reconcile multiple evaluation metrics in the existing literature and cover diverse notions for a holistic evaluation. Our graph datasets range from citation networks, document graphs, to graphs from molecules and proteins. We conduct an extensive empirical study on four GNN models and nine post-hoc explanation approaches for node and graph classification tasks. We open both the benchmarks and reference implementations and make them available at https://github.com/Mandeep-Rathee/Bagel-benchmark.

研究の動機と目的

  • GNNの説明手法を評価するための標準的で包括的なベンチマークの欠如に対処すること。
  • 忠実性、スパarsity、正しさ、妥当性といった多様な評価メトリクスと概念を、1つの拡張可能なフレームワークに統合すること。
  • 実世界のデータセットとリファレンス実装を備えたモジュラーでオープンソースのベンチマークを提供し、GNNの解釈可能性分野における新規研究の障壁を低減すること。
  • 複数のGNNモデルとタスクにおいて、9種類の事後的GNN説明手法の性能を実証的に評価すること。

提案手法

  • 忠実性(RDT-Fidelityを用いて)、スパarsity(説明のサイズを測定)、正しさ(不正な相関を注入して)、妥当性(人間の根拠と比較)の4つの評価レジームを提案する。
  • 複数のGNNモデル(GCN、GAT、GIN、APPNP)と説明手法(例:GNNExplainer、Grad、IG、GradCAM)をサポートするモジュラーで拡張可能なフレームワークを導入する。
  • 学術論文ネットワーク(Cora、Citeseer、PubMed)、生物学的ネットワーク(PROTEINS、MUTAG)、テキストベースの映画レビューなどの実世界のデータセットを用いる。
  • ソフトマスクとハードマスクの両方の生成戦略を採用し、ハードマスクの場合はしきい値(例:平均)を用い、AUPRCベースの妥当性スコアにはソフトマスクを直接利用する。
  • 先行研究のメトリクス(包括性、十分性、忠実性)を統一して調整することで、評価の一貫性を確保する。
  • リファレンス実装を提供し、ベンチマークをhttps://github.com/Mandeep-Rathee/Bagel-benchmarkにてオープンソース化する。

実験結果

リサーチクエスチョン

  • RQ1実世界のデータセットにおいて、忠実性、スパarsity、正しさ、妥当性という複数の評価軸で、どのGNN説明手法が最も優れているか?
  • RQ2異なるしきい値戦略を用いて変換された場合、ソフトマスクとハードマスクの説明は、安定性と性能の面でどのように異なるか?
  • RQ3人間がアノテートした根拠との比較による妥当性スコアで測定した場合、説明手法は人間の推論をどの程度反映しているか?
  • RQ4GNNモデルの選択(例:GCN対GIN)が、異なる評価メトリクスにおける説明の質にどのように影響するか?
  • RQ5不正な相関を意図的に注入することで、GNNにおける説明の正しさを効果的に測定できるか?

主な発見

  • どのメトリクスにおいても一貫して優れた性能を示す説明手法は存在せず、忠実性、スパarsity、正しさ、妥当性の間には複雑なトレードオフが存在することが示された。
  • GNNExplainerはCoraにおいて忠実性と正しさで高い性能を示した(k=20のときF1 = 0.67)が、映画レビューでは説明サイズが大きいため、妥当性が低かった(F1 = 0.35)。
  • GradCAMは映画レビューデータセットにおいて、全GNNモデルで最高の妥当性スコア(AUPRC = 0.67)を達成したが、F1が低く(0.34)いため、再現率は高いが精度は低いことが示された。
  • スパarsityは極めて重要である。平均値をしきい値として用いたハードマスク変換では、非常に大きな説明(例:約150〜400ノード)が得られ、不要なノードが含まれるため、正しさの精度(例:F1 < 0.25)が著しく低下した。
  • 高いRDT-Fidelityは説明の安定性と相関しており、入力特徴量が解釈可能である場合、忠実性メトリクスは最も信頼性が高い。特徴量が解釈不能な場合は、構造ベースの説明が好ましい。
  • 妥当性スコアは説明手法とGNNモデルの両方に敏感であり、性能の悪さがモデル由来か説明手法由来かを明確に分離するのは困難である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。