[论文解读] SAFARI: Versatile and Efficient Evaluations for Robustness of Interpretability
本文提出 SAFARI,一种用于评估深度学习可解释性鲁棒性的黑箱评估框架,采用两种新颖指标:最坏情况解释差异和概率性解释鲁棒性。该框架利用带定制适应度函数的遗传算法(GA)与子集模拟(Subset Simulation),高效检测罕见误解释事件,在多种XAI方法和数据集上,其准确率、灵敏度和效率均优于最先进方法。
Interpretability of Deep Learning (DL) is a barrier to trustworthy AI. Despite great efforts made by the Explainable AI (XAI) community, explanations lack robustness -- indistinguishable input perturbations may lead to different XAI results. Thus, it is vital to assess how robust DL interpretability is, given an XAI method. In this paper, we identify several challenges that the state-of-the-art is unable to cope with collectively: i) existing metrics are not comprehensive; ii) XAI techniques are highly heterogeneous; iii) misinterpretations are normally rare events. To tackle these challenges, we introduce two black-box evaluation methods, concerning the worst-case interpretation discrepancy and a probabilistic notion of how robust in general, respectively. Genetic Algorithm (GA) with bespoke fitness function is used to solve constrained optimisation for efficient worst-case evaluation. Subset Simulation (SS), dedicated to estimate rare event probabilities, is used for evaluating overall robustness. Experiments show that the accuracy, sensitivity, and efficiency of our methods outperform the state-of-the-arts. Finally, we demonstrate two applications of our methods: ranking robust XAI methods and selecting training schemes to improve both classification and interpretation robustness.
研究动机与目标
- 为解决深度学习可解释性鲁棒性评估中缺乏全面、通用且高效评估指标的问题。
- 克服评估异构XAI方法(尤其是基于扰动的方法)的挑战,尤其在无需访问模型内部结构的情况下进行评估。
- 通过黑箱优化与统计采样,实现对局部范数球内罕见误解释事件的有效检测。
- 提供一个整体性评估框架,同时兼顾最坏情况与概率性鲁棒性视角。
- 展示实际应用:对XAI方法进行排序,并识别能同时提升分类与解释鲁棒性的训练方案。
提出的方法
- 提出两种互补的鲁棒性指标:最坏情况解释差异(通过皮尔逊相关系数PCC衡量)和概率性鲁棒性(估计为在范数球内发生误解释的概率)。
- 采用无需模型内部信息的黑箱遗传算法(GA),并设计定制适应度函数,求解约束优化问题,以识别使解释差异最大化的对抗性扰动。
- 采用子集模拟(SS),一种用于罕见事件概率估计的统计方法,高效计算局部邻域内误解释发生的概率。
- 在GA中设计专用适应度函数,引导搜索过程聚焦于引发最大解释变化但保持模型预测不变的对抗性扰动。
- 将SS方法适配用于估计低概率误解释事件,通过迭代从条件分布中采样,显著提升效率,优于标准蒙特卡洛方法。
- 在多种数据集(MNIST、CIFAR-10、CelebA、ImageNet)和XAI方法(Gradient×Input、Integrated Gradients、GradCAM、FullGrad、Extremal Perturbations)上应用该框架。
实验结果
研究问题
- RQ1如何全面评估深度学习可解释性鲁棒性,超越二元对抗检测的范畴?
- RQ2哪些黑箱方法能高效检测局部范数球内罕见误解释事件,且无需梯度或模型内部信息?
- RQ3哪些XAI方法对保持模型预测的扰动和改变模型预测的扰动均表现出最强鲁棒性?
- RQ4在不同神经网络架构下,解释鲁棒性与分类鲁棒性之间的相关性在多大程度上成立?
- RQ5能否识别出能同时提升分类与解释鲁棒性的训练方案?
主要发现
- 在CIFAR-10上,Integrated Gradients在不同架构中均表现出最高鲁棒性,最坏情况差异低且概率性鲁棒性高。
- Integrated Gradients的概率性鲁棒性指标(ln P)在ResNet20上为-35.93,在VGG16上为-47.52,表明其对误解释具有强抵抗能力。
- 实证观察到分类鲁棒性与解释鲁棒性之间存在强相关性,提示二者可能存在共同的内在原因,如损失函数曲率。
- FullGrad通过融合逐层梯度,优于单一方法,在ImageNet上实现PCC为0.799,ln P为-75.716,表明其具有极高鲁棒性。
- 基于GA的最坏情况评估实现了高灵敏度与高效率,以极低计算开销检测到对抗性扰动。
- 子集模拟成功以高精度估计罕见误解释概率,在计算成本方面优于标准蒙特卡洛采样。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。