Skip to main content
QUICK REVIEW

[论文解读] Explaining the Explainers in Graph Neural Networks: a Comparative Study

Antonio Longa, Steve Azzolin|arXiv (Cornell University)|Oct 27, 2022
Advanced Graph Neural Networks被引用 5
一句话总结

本文通过系统性实验研究,评估了十种GNN解释器在六个图分类和节点分类数据集上的八种GNN架构中的表现。研究发现,可解释性在不同架构和解释器类型之间存在显著差异:在节点分类任务中,基于梯度的方法表现最佳;在图分类任务中,尤其是当特征缺失时,基于边的解释器显著优于基于节点的解释器。

ABSTRACT

Following a fast initial breakthrough in graph based learning, Graph Neural Networks (GNNs) have reached a widespread application in many science and engineering fields, prompting the need for methods to understand their decision process. GNN explainers have started to emerge in recent years, with a multitude of methods both novel or adapted from other domains. To sort out this plethora of alternative approaches, several studies have benchmarked the performance of different explainers in terms of various explainability metrics. However, these earlier works make no attempts at providing insights into why different GNN architectures are more or less explainable, or which explainer should be preferred in a given setting. In this survey, we fill these gaps by devising a systematic experimental study, which tests ten explainers on eight representative architectures trained on six carefully designed graph and node classification datasets. With our results we provide key insights on the choice and applicability of GNN explainers, we isolate key components that make them usable and successful and provide recommendations on how to avoid common interpretation pitfalls. We conclude by highlighting open questions and directions of possible future research.

研究动机与目标

  • 为解决GNN架构与解释器类型联合影响可解释性的系统性评估不足的问题。
  • 识别在不同数据设置下(如节点分类与图分类、特征可用性)最有效的解释器方法。
  • 揭示当前解释器评估中的常见陷阱,如保真度偏差和人工标注真实标签中的偏见。
  • 基于GNN架构和任务类型,提供选择解释器的实际建议。
  • 突出GNN可解释性中的开放挑战,特别是聚合机制和度量设计的影响。

提出的方法

  • 在包括GCN、GAT、GraphSAGE和GIN在内的八种代表性GNN架构中,评估了十种最先进解释器。
  • 使用六个精心设计的数据集进行节点分类和图分类,控制图的拓扑结构和特征属性。
  • 应用多种可解释性度量:保真度、全面性、合理性与充分性,以评估解释质量。
  • 通过消融研究隔离GNN架构组件(如聚合机制)对解释质量的影响。
  • 比较不同解释器类别(基于梯度、基于扰动、基于分解、基于代理模型)的表现。
  • 通过保真度-合理性权衡分析人工标注的真实解释与模型生成解释之间的差异。

实验结果

研究问题

  • RQ1RQ1:GNN架构的选择如何影响解释的质量与一致性?
  • RQ2RQ2:不同解释器类别(如基于梯度、基于扰动)在各种GNN架构和任务中的表现如何?
  • RQ3RQ3:数据特征(如特征可用性、图拓扑)如何影响解释器的有效性?
  • RQ4RQ4:当前评估实践中的关键陷阱是什么,如保真度偏差和人工标注真实标签中的偏见?
  • RQ5RQ5:哪种解释器类型最适合节点分类与图分类?原因是什么?

主要发现

  • 基于梯度的解释器在节点分类任务中始终优于其他类别,可能是因为其感受野集中于目标节点的邻域。
  • 基于边的解释器,特别是使用扰动或梯度技术的,显著优于基于节点的解释器,尤其在节点特征不可用时,其在图分类任务中表现更优。
  • 仅依赖保真度是存在偏差的度量——尤其在图分类中,求和聚合会降低图嵌入的范数,即使子结构正确,保真度也会降低。
  • 高保真度与低合理性(或反之)的不匹配通常表明GNN学习到了非直观或有偏见的概念,与人类预期概念不一致。
  • GNN架构在内在可解释性方面存在显著差异,挑战了‘解释器真正与模型无关’的假设。
  • GNN中聚合机制对可解释性具有关键影响,但目前研究仍不足,提示未来需开发聚合感知型解释器。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。