Skip to main content
QUICK REVIEW

[论文解读] GRAPHSHAP: Explaining Identity-Aware Graph Classifiers Through the Language of Motifs

Alan Perotti, Paolo Bajardi|arXiv (Cornell University)|Feb 17, 2022
Explainable Artificial Intelligence (XAI)被引用 4
一句话总结

GRAPHSHAP 提出了一种模型无关的、基于 Shapley 值的方法,通过网络基序(network motifs)作为可解释的表达语言,来解释身份感知的图分类器。它利用一种渐进式核函数高效近似基序重要性得分,实现了可扩展的、可操作的解释——在脑网络数据上的实验表明,少数基序(如 M5)能强有力地解释自闭症谱系障碍的分类结果。

ABSTRACT

Most methods for explaining black-box classifiers (e.g. on tabular data, images, or time series) rely on measuring the impact that removing/perturbing features has on the model output. This forces the explanation language to match the classifier's feature space. However, when dealing with graph data, in which the basic features correspond to the edges describing the graph structure, this matching between features space and explanation language might not be appropriate. Decoupling the feature space (edges) from a desired high-level explanation language (such as motifs) is thus a major challenge towards developing actionable explanations for graph classification tasks. In this paper we introduce GRAPHSHAP, a Shapley-based approach able to provide motif-based explanations for identity-aware graph classifiers, assuming no knowledge whatsoever about the model or its training data: the only requirement is that the classifier can be queried as a black-box at will. For the sake of computational efficiency we explore a progressive approximation strategy and show how a simple kernel can efficiently approximate explanation scores, thus allowing GRAPHSHAP to scale on scenarios with a large explanation space (i.e. large number of motifs). We showcase GRAPHSHAP on a real-world brain-network dataset consisting of patients affected by Autism Spectrum Disorder and a control group. Our experiments highlight how the classification provided by a black-box model can be effectively explained by few connectomics patterns.

研究动机与目标

  • 解决图分类模型缺乏可操作的高层次解释的问题,尤其是在特征空间(边)与人类可理解的结构不一致的情况下。
  • 将模型的内部特征空间(边)与期望的解释语言(基序)解耦,实现在无需访问模型的情况下获得可解释的洞察。
  • 为身份感知的图分类器(即节点身份在图之间保持一致)开发一种可扩展的黑箱解释方法,通过基于基序的归因实现。
  • 通过一种渐进式近似核方法,实现对大规模基序空间中 Shapley 值的高效计算,使大规模基序归因成为可能。
  • 在真实世界脑网络数据上验证该方法,以揭示与自闭症谱系障碍相关的连接组学模式。

提出的方法

  • 将合作博弈论中的 Shapley 值适配到基序的重要性归因,而非边,将每个基序视为游戏中的一名‘玩家’,其中‘收益’为模型预测的变化。
  • 定义一个合作博弈,其值函数衡量在图中添加或移除某个基序时模型输出的变化,使用切换掩码(toggle masking)来模拟基序的有无状态。
  • 提出一种渐进式近似策略,仅计算深度为1的 Shapley 值(即仅考虑单个基序的组合),显著降低计算成本。
  • 设计一种基于核的近似方法,通过采样和平均基序子集来高效估计 Shapley 分数,从而实现对大规模基序空间的可扩展性。
  • 使用切换掩码来模拟图中基序的有无状态:对每个基序,分别查询原始图和该基序被切换(添加/移除)后的图版本。
  • 将数据集上所有局部解释聚合,得出全局基序重要性排序,从而支持假设生成与验证。

实验结果

研究问题

  • RQ1与基于边的解释相比,基于基序的解释是否能提供更具可操作性和可解释性的洞察?
  • RQ2如何将 Shapley 值适配到对高阶网络结构(基序)的重要性归因,而非单个边?
  • RQ3何种近似策略能够在不牺牲准确性的前提下,实现大规模基序空间中基序 Shapley 值的可扩展计算?
  • RQ4基于基序的解释在多大程度上能揭示真实脑网络数据中具有生物学意义的模式?
  • RQ5局部与全局基序重要性得分之间的相关性如何?全局排序是否能指导关键连接组学模式的发现?

主要发现

  • 在脑网络数据集上,深度为1的 Shapley 值近似与精确值之间的皮尔逊相关系数中位数达到 0.997,证实了其在极低计算成本下仍保持高度保真度。
  • 仅有少数基序(如 M5)表现出持续的高全局重要性,表明少数连接组学模式主导了模型预测。
  • M5 是全局最重要的基序,且在 ASD 患者 P1 和 P2 上均表现出强烈的局部解释得分,表明其在分类中起核心作用。
  • M2 在一名患者(P2)中具有高局部重要性,但全局重要性可忽略,凸显了局部解释在揭示细微决策驱动因素方面的价值。
  • 该方法实现了对 100 个基序的高效归因,计算成本呈线性增长,相比精确计算节省了约 10^26 次操作。
  • 该方法成功生成了可操作的、与神经科学相关的假设——例如,M5 的缺失对 ASD 分类有显著贡献——验证了其在真实世界应用中的实用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。