Skip to main content
QUICK REVIEW

[论文解读] BAGEL: A Benchmark for Assessing Graph Neural Network Explanations

Mandeep Rathee, Thorben Funke|arXiv (Cornell University)|Jun 28, 2022
Machine Learning in Materials Science被引用 6
一句话总结

该论文提出了BAGEL,一个全面的基准测试,用于在忠实性、稀疏性、正确性和合理性四个评估维度上评估图神经网络(GNN)解释。它将多样化的度量标准、数据集和解释方法统一到一个模块化框架中,揭示了没有一种方法在所有度量标准上始终优于其他方法,强调了在GNN可解释性研究中需要多维度评估。

ABSTRACT

The problem of interpreting the decisions of machine learning is a well-researched and important. We are interested in a specific type of machine learning model that deals with graph data called graph neural networks. Evaluating interpretability approaches for graph neural networks (GNN) specifically are known to be challenging due to the lack of a commonly accepted benchmark. Given a GNN model, several interpretability approaches exist to explain GNN models with diverse (sometimes conflicting) evaluation methodologies. In this paper, we propose a benchmark for evaluating the explainability approaches for GNNs called Bagel. In Bagel, we firstly propose four diverse GNN explanation evaluation regimes -- 1) faithfulness, 2) sparsity, 3) correctness. and 4) plausibility. We reconcile multiple evaluation metrics in the existing literature and cover diverse notions for a holistic evaluation. Our graph datasets range from citation networks, document graphs, to graphs from molecules and proteins. We conduct an extensive empirical study on four GNN models and nine post-hoc explanation approaches for node and graph classification tasks. We open both the benchmarks and reference implementations and make them available at https://github.com/Mandeep-Rathee/Bagel-benchmark.

研究动机与目标

  • 为解决缺乏标准化、整体性的GNN解释方法评估基准的问题。
  • 将忠实性、稀疏性、正确性和合理性等多样化的评估度量与概念统一到一个单一、可扩展的框架中。
  • 提供一个模块化、开源的基准,包含真实世界数据集和参考实现,以降低GNN可解释性研究的门槛。
  • 在多个GNN模型和任务上,对九种事后GNN解释方法的性能进行实证评估。

提出的方法

  • 提出四种评估范式:通过RDT-Fidelity评估忠实性,通过测量解释大小评估稀疏性,通过注入虚假相关性评估正确性,通过与人类推理进行比较评估合理性。
  • 引入一个模块化、可扩展的框架,支持多种GNN模型(GCN、GAT、GIN、APPNP)和解释方法(如GNNExplainer、Grad、IG、GradCAM)。
  • 使用真实世界数据集,包括引文网络(Cora、Citeseer、PubMed)、生物网络(PROTEINS、MUTAG)以及基于文本的电影评论数据。
  • 采用软掩码和硬掩码生成策略,硬掩码通过阈值化(如均值)生成,软掩码则直接用于基于AUPRC的合理性评分。
  • 通过调和先前工作中使用的度量标准(包括全面性、充分性和保真度),实现评估的标准化,确保一致性。
  • 提供参考实现,并在 https://github.com/Mandeep-Rathee/Bagel-benchmark 开源该基准。

实验结果

研究问题

  • RQ1在真实世界数据集上,哪些GNN解释方法在多个评估轴(忠实性、稀疏性、正确性、合理性)上表现最佳?
  • RQ2在使用不同阈值化策略转换时,软掩码和硬掩码解释在稳定性和性能方面如何比较?
  • RQ3在多大程度上,解释方法能反映人类推理?这通过与人工标注的推理进行合理性对比来衡量。
  • RQ4GNN模型的选择(如GCN与GIN)如何影响不同评估度量下解释的质量?
  • RQ5通过对抗性注入虚假相关性,能否有效衡量GNN中解释的正确性?

主要发现

  • 没有一种解释方法在所有评估度量标准上始终优于其他方法,表明在忠实性、稀疏性、正确性和合理性之间存在复杂的权衡。
  • GNNExplainer在Cora数据集上表现出较高的忠实性和正确性(k=20时F1=0.67),但在电影评论数据集上其合理性较低(F1=0.35),原因是解释规模过大。
  • GradCAM在所有GNN模型的电影评论数据集上获得了最高的合理性得分(AUPRC=0.67),尽管其F1值较低(0.34),表明其具有高召回率但低精确率。
  • 稀疏性至关重要:使用均值作为硬掩码转换的阈值会导致解释规模非常大(例如,约150–400个节点),从而因包含无关节点而导致正确性精确率极低(例如,F1<0.25)。
  • 高RDT-Fidelity与解释稳定性相关,且当输入特征可解释时,忠实性度量最为可靠;当特征不可解释时,应优先选择基于结构的解释。
  • 合理性得分对解释器和GNN模型均敏感,使得难以区分性能不佳是源于模型本身还是解释方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。