[论文解读] Aggregating explanation methods for stable and robust explainability
本文提出通过聚合多种神经网络解释方法来提升解释的稳定性、鲁棒性与特征完整性。通过采用均值或方差为基础的聚合策略(AGG-Mean 与 AGG-Var)整合 Grad-CAM、Guided Backpropagation 和 LRP 等方法,该方法有效降低了认知不确定性,并显著增强了对对抗攻击的抵抗能力,在 ImageNet、MNIST 和 FashionMNIST 数据集上均优于单一方法。
Despite a growing literature on explaining neural networks, no consensus has been reached on how to explain a neural network decision or how to evaluate an explanation. Our contributions in this paper are twofold. First, we investigate schemes to combine explanation methods and reduce model uncertainty to obtain a single aggregated explanation. We provide evidence that the aggregation is better at identifying important features, than on individual methods. Adversarial attacks on explanations is a recent active research topic. As our second contribution, we present evidence that aggregate explanations are much more robust to attacks than individual explanation methods.
研究动机与目标
- 通过结合多种解释方法,减少神经网络解释中的认知不确定性。
- 通过聚合多样化的解释技术,提升解释的稳定性和完整性。
- 增强解释方法对对抗攻击的鲁棒性。
- 评估聚合解释是否在识别相关特征和抵抗干扰方面优于单一方法。
- 探究聚合过程是否能在不修改模型的前提下,实现类似 SmoothGrad 的平滑效果,提升解释的可靠性。
提出的方法
- 提出两种聚合策略:AGG-Mean 通过计算多个方法生成的显著性图的逐元素均值得到聚合结果;AGG-Var 则利用解释结果的方差识别显著区域。
- 将聚合方法应用于多种解释方法:显著性图(SM)、引导反向传播(GB)、LRP、Grad-CAM(GC)、积分梯度(IG)和 SmoothGrad(SG)。
- 采用多阶段评估框架,包括敏感性分析(Sensitivity-n)、特征相关性比较以及对抗攻击的可迁移性测试。
- 使用皮尔逊积矩相关系数(PCC)、均方误差(MSE)和前10%区域并集等指标评估解释质量与鲁棒性。
- 对单一方法实施对抗攻击后,再对聚合解释进行攻击,以测试其可迁移性与抗扰动能力。
- 在 ImageNet、MNIST 和 FashionMNIST 等多个数据集及多种网络架构上进行可视化与性能对比,评估解释效果与鲁棒性。
实验结果
研究问题
- RQ1聚合多种解释方法是否能降低认知不确定性,并产生比单一方法更稳定、更完整的解释?
- RQ2聚合多样化解释方法是否能在不同架构与数据集上提升对图像相关特征的识别性能?
- RQ3在对抗攻击下,聚合解释方法的鲁棒性是否显著优于单一解释方法?
- RQ4聚合过程在多大程度上降低了对抗攻击在不同解释方法间的可迁移性?
- RQ5聚合是否能在不增加额外计算开销的前提下,实现类似 SmoothGrad 的平滑效果?
主要发现
- 在 ImageNet、MNIST 和 FashionMNIST 上,AGG-Mean 在所有指标上均优于所有单一解释方法,其 MSE 最低(0.89 × 10⁻⁹),PCC 最高(0.54)。
- 聚合解释方法表现出显著更高的对抗攻击鲁棒性,相似性指标(PCC 与 topK)表明攻击对聚合结果的可迁移性更低。
- 针对单一方法(如 GB)的对抗攻击难以有效转移到其他方法(如 LRP),更难以影响聚合解释,表明其具备更强的抗扰动能力。
- AGG-Mean 在攻击下最完整地保留了原始解释结构,如图6所示,即使在扰动下仍保持热力图的完整性。
- 该聚合策略通过方法多样性实现了内在平滑效果,无需像 SmoothGrad 那样对模型进行修改。
- 在所有测试的架构与数据集上,聚合方法在解释质量与对抗鲁棒性方面均持续优于单一方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。