Skip to main content
QUICK REVIEW

[論文レビュー] Towards Robust Fidelity for Evaluating Explainability of Graph Neural Networks

Xu Zheng, Farhad Shirani|arXiv (Cornell University)|Oct 3, 2023
Explainable Artificial Intelligence (XAI)被引用数 4
ひとこと要約

本論文は、既存の忠実度メトリクスにおける分布シフトの重大な欠陥に対処することで、グラフニューラルネットワーク(GNN)の説明可能性を評価する、耐障害性があり情報理論的根拠を持つフレームワークを提案する。分布シフトに強い新規メトリクス—$Fid_{\alpha_1,+}$、$Fid_{\alpha_2,-}$、$Fid_{\alpha_1,\alpha_2,\Delta}$—を導入し、多様なデータセットにおいてゴールスタンダードの編集距離と著しく高い整合性を示し、従来の$Fid_+$、$Fid_-$、$Fid_\Delta$に比べて一貫性と信頼性が優れている。

ABSTRACT

Graph Neural Networks (GNNs) are neural models that leverage the dependency structure in graphical data via message passing among the graph nodes. GNNs have emerged as pivotal architectures in analyzing graph-structured data, and their expansive application in sensitive domains requires a comprehensive understanding of their decision-making processes -- necessitating a framework for GNN explainability. An explanation function for GNNs takes a pre-trained GNN along with a graph as input, to produce a `sufficient statistic' subgraph with respect to the graph label. A main challenge in studying GNN explainability is to provide fidelity measures that evaluate the performance of these explanation functions. This paper studies this foundational challenge, spotlighting the inherent limitations of prevailing fidelity metrics, including $Fid_+$, $Fid_-$, and $Fid_Δ$. Specifically, a formal, information-theoretic definition of explainability is introduced and it is shown that existing metrics often fail to align with this definition across various statistical scenarios. The reason is due to potential distribution shifts when subgraphs are removed in computing these fidelity measures. Subsequently, a robust class of fidelity measures are introduced, and it is shown analytically that they are resilient to distribution shift issues and are applicable in a wide range of scenarios. Extensive empirical analysis on both synthetic and real datasets are provided to illustrate that the proposed metrics are more coherent with gold standard metrics. The source code is available at https://trustai4s-lab.github.io/fidelity.

研究の動機と目的

  • 既存のGNN説明忠実度メトリクスにおける根本的欠陥—説明部分グラフの削除に起因する分布シフトへの感受性—を特定・是正すること。
  • 十分統計量および最小部分グラフサイズに基づく、形式的かつ情報理論的定義によるGNN説明可能性の定式化。
  • 理論的根拠に基づき、現実のグラフデータにおける分布シフトに耐性を持つ代替忠実度メトリクスの開発。
  • 提案メトリクスが合成および実世界データセットにおけるゴールスタンダードの編集距離とどの程度整合するかを実証的に検証すること。
  • 複雑で非決定的である方法に依存しない、XAIにおけるグラフ学習のための安定的かつ決定的評価フレームワークの提供。

提案手法

  • 説明可能性の情報理論的定義を導入し、ラベルに対して(ほぼ)十分統計量であり、かつサイズが最小である部分グラフを要件とする。
  • 分布シフトの影響を軽減するため、エッジの削除率と保持率を制御する新しい忠実度メトリクス—$Fid_{\alpha_1,+}$、$Fid_{\alpha_2,-}$、$Fid_{\alpha_1,\alpha_2,\Delta}$—を提案。
  • パラメータ化された摂動戦略を採用し、$Fid_{\alpha_1,+}$ では $\alpha_1$ が説明部分グラフから削除されるエッジの割合を制御し、$Fid_{\alpha_2,-}$ では $\alpha_2$ が非説明部分グラフから保持されるエッジの割合を制御する。
  • 複数のデータセットおよびモデルで、提案メトリクスとゴールスタンダードの編集距離とのスピアマン順位相関を主評価指標として用いる。
  • 各データセットあたり50回のサンプリング反復を実施する制御された実験設定により、相関スコアの統計的信頼性を確保。
  • GCNおよびGINモデルを用いて、合成データ(Tree-Cycles、Tree-Grid、BA-2motifs)および実世界データ(MUTAG)の両方でメトリクスを検証。
(a) $Fid_{\alpha_{1},+}$ on Tree-Circles
(a) $Fid_{\alpha_{1},+}$ on Tree-Circles

実験結果

リサーチクエスチョン

  • RQ1なぜ従来の忠実度メトリクス $Fid_+$、$Fid_-$、$Fid_\Delta$ は、部分グラフ削除に起因する分布シフトの影響を受けて、ゴールスタンダードの説明品質と一致しなくなるのか?
  • RQ2理論的根拠に基づく情報理論的フレームワークが、GNNの説明可能性に対してより耐障害性があり信頼性の高い忠実度メトリクスを生み出すことができるか?
  • RQ3提案されたパラメータ化されたメトリクス $Fid_{\alpha_1,+}$ および $Fid_{\alpha_2,-}$ は、ベースラインメトリクスに比べてゴールスタンダードの編集距離との整合性をどの程度向上させるか?
  • RQ4ハイパーパrameter $\alpha_1$ および $\alpha_2$ は、提案メトリクスの耐障害性およびゴールスタンダードとの相関にどのように影響を与えるか?
  • RQ5なぜ既存のメトリクスはTree-GridデータセットにおけるGINモデルの評価に失敗するのか?提案フレームワークはこの問題を解決できるか?

主な発見

  • 提案された $Fid_{\alpha_1,+}$ メトリクスは、すべてのデータセットでゴールスタンダードの編集距離と完全に逆相関(スピアマン相関 = -1.0)を示し、安定した逆関係を示している。
  • 元の $Fid_+$ メトリクスは一貫性のない相関(例:Tree-Cyclesで0.229、BA-2motifsで-0.924)を示し、その不安定さとゴールスタンダードとの不一致が顕著に表れている。
  • 提案された $Fid_{\alpha_2,-}$ はTree-GridおよびBA-2motifsでゴールスタンダードと完全な相関(1.000)を達成し、元の $Fid_-$ が混合結果を示すのに対し顕著に優れている。
  • $Fid_{\alpha_1,\alpha_2,\Delta}$ メトリクスは、すべてのデータセットでゴールスタンダードと完全に逆相関(-1.000)を示し、優れた整合性と耐障害性を示している。
  • エッジ分類のAUC指標はゴールスタンダードの編集距離と完全に一致(相関 = -1.000)しており、信頼できるベンチマークとしての有効性が検証された。
  • GINモデルは、すべての忠実度メトリクスでTree-Gridデータセットの評価に失敗しており、これはノード分類タスクにおける一般化性能の低さが原因とされ、提案メトリクスでもこの制限は解消されていない。
(b) $Fid_{\alpha_{2},-}$ on Tree-Circles
(b) $Fid_{\alpha_{2},-}$ on Tree-Circles

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。