[论文解读] Explainability in Graph Neural Networks: An Experimental Survey
本文对图神经网络(GNN)可解释性方法进行了全面的实验调查,提出了一种新型的无需人工参与的评估指标——解释置信度,以客观地在真实世界数据集上对方法进行基准测试。结果表明,GraphMASK在高置信度水平下表现优于GNNExplainer和PGExplainer,这主要得益于其对层特定重要性的建模能力,而GNNExplainer在深层模型(如GCNII)上表现不佳。
Graph neural networks (GNNs) have been extensively developed for graph representation learning in various application domains. However, similar to all other neural networks models, GNNs suffer from the black-box problem as people cannot understand the mechanism underlying them. To solve this problem, several GNN explainability methods have been proposed to explain the decisions made by GNNs. In this survey, we give an overview of the state-of-the-art GNN explainability methods and how they are evaluated. Furthermore, we propose a new evaluation metric and conduct thorough experiments to compare GNN explainability methods on real world datasets. We also suggest future directions for GNN explainability.
研究动机与目标
- 解决现有研究中缺乏对真实世界数据集上GNN可解释性方法的全面、客观评估的问题。
- 提出一种无需人工标注真实标签的评估指标——解释置信度,以实现无需人工参与的定量、可扩展比较。
- 使用多样化的GNN架构(GCN、GAT、GCNII)在真实世界的引文网络上评估最先进的GNN可解释性方法(GNNExplainer、PGExplainer、GraphMASK)。
- 探究可解释性方法在不同GNN架构(包括GCNII等深层模型)上的表现,这些模型在先前工作中尚未被充分探索。
- 为现有可解释性方法的局限性提供关键洞见,并为GNN可解释性的未来研究方向提供建议。
提出的方法
- 提出一种名为“解释置信度”的新评估指标,用于衡量在不同置信度水平下解释的稀疏性,从而实现无需人工参与的客观比较。
- 采用多层级评估策略:对每个模型和数据集,从0.50到0.95的置信度水平计算解释稀疏性,并对结果取平均。
- 使用三个真实世界的引文网络——Cora、Citeseer和Pubmed——作为基准数据集进行评估。
- 训练具有不同深度(GCN和GAT为2层,GCNII最多达64层)的GCN、GAT和GCNII模型,并应用GNNExplainer、PGExplainer和GraphMASK对测试集上的预测结果进行解释。
- 对GraphMASK和PGExplainer采用单实例学习和模型级学习两种策略,以评估训练策略对解释质量的影响。
- 使用标准的保真度和反保真度指标进行交叉验证,但强调新提出的解释置信度指标作为主要基准。
实验结果
研究问题
- RQ1现有GNN可解释性方法在除合成数据或小分子数据外的真实世界数据集上的表现如何?
- RQ2GNN可解释性方法在不同GNN架构上的表现如何变化,特别是在浅层模型(GCN、GAT)与深层模型(GCNII)之间?
- RQ3能否有效利用无需人工参与的评估指标,以可扩展且客观的方式比较GNN可解释性方法?
- RQ4当前可解释性方法(如GNNExplainer)在应用于具有更多参数的深层GNN时存在哪些局限性?
- RQ5不同的训练策略(单实例学习与模型级学习)如何影响GraphMASK和PGExplainer生成的解释质量?
主要发现
- GraphMASK在所有数据集和GNN架构上均持续优于GNNExplainer和PGExplainer,尤其在高解释置信度水平(如0.90–0.95)下表现更优,表明其解释更忠实且更稳定。
- 当应用于深层模型(如GCNII)时,GNNExplainer表现出显著的性能下降,表明其在架构复杂性面前可扩展性和鲁棒性有限。
- PGExplainer在浅层模型(GCN、GAT)上表现较差,但在GCNII上有所改善,表明其可能对模型深度和架构敏感。
- 所提出的解释置信度指标能够在无需人工标注真实标签的前提下,实现可靠、可扩展且客观的跨数据集和模型比较。
- 单实例学习策略在GraphMASK上表现优于模型级学习策略,而PGExplainer在两种训练策略下的表现相近。
- 保真度和反保真度指标确认了GraphMASK的优越性,但GNNExplainer在Cora数据集的GAT上保真度表现更优,在Pubmed数据集的GCNII上反保真度表现更优,凸显了不同指标之间的不一致性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。