[论文解读] Representativity and Consistency Measures for Deep Neural Network Explanations
本文提出了两种基于算法稳定性的新度量方法——平均泛化能力(MeGe)和相对一致性(ReCo),以客观评估深度神经网络解释的质量。通过应用k折交叉训练来评估稳定性,作者发现即使在准确率相近的情况下,1-Lipschitz网络产生的解释也显著更具泛化能力和一致性,凸显了迈向更可信人工智能系统的一条有前景路径。
A plethora of methods have been proposed to explain how deep neural networks reach their decisions but comparatively, little effort has been made to ensure that the explanations produced by these methods are objectively relevant. While several desirable properties for trustworthy explanations have been formulated, objective measures have been harder to derive. Here, we propose two new measures to evaluate explanations borrowed from the field of algorithmic stability: mean generalizability MeGe and relative consistency ReCo. We conduct extensive experiments on different network architectures, common explainability methods, and several image datasets to demonstrate the benefits of the proposed measures.In comparison to ours, popular fidelity measures are not sufficient to guarantee trustworthy explanations.Finally, we found that 1-Lipschitz networks produce explanations with higher MeGe and ReCo than common neural networks while reaching similar accuracy. This suggests that 1-Lipschitz networks are a relevant direction towards predictors that are more explainable and trustworthy.
研究动机与目标
- 解决深度神经网络解释缺乏客观、可信评估指标的问题。
- 识别现有基于保真度的度量方法的局限性,这些方法无法评估解释的稳定性和可信度。
- 提出基于算法稳定性的度量方法——MeGe和ReCo,用于评估解释的泛化能力和一致性。
- 探究如1-Lipschitz正则化等架构约束是否能提升解释质量。
- 证明1-Lipschitz网络在不损失准确率的前提下,能产生更稳定、更可靠的解释。
提出的方法
- 提出平均泛化能力(MeGe)作为衡量解释在同类正确分类图像中是否一致指向相似特征的指标。
- 引入相对一致性(ReCo)以评估错误分类图像的解释与正确分类图像的解释是否存在显著差异。
- 使用k折交叉训练来估计MeGe和ReCo,即在不同训练数据子集上训练多个预测器,并比较相同输入的解释。
- 在多种架构、可解释性方法(如Grad-CAM、SmoothGrad、Grad-Input)以及CIFAR-10和ImageNet等数据集上应用这些度量。
- 使用Deel-Lip库训练1-Lipschitz神经网络,以评估其对MeGe和ReCo得分的影响。
- 通过解释相似度得分(S= 和 S≠)的直方图分析,直观验证1-Lipschitz模型在一致性和泛化能力方面的提升。
实验结果
研究问题
- RQ1像泛化能力和一致性这样的算法稳定性度量,能否作为评估深度学习解释可信度的可靠、客观指标?
- RQ2与MeGe和ReCo相比,现有基于保真度的度量方法在识别可信解释方面表现如何?
- RQ31-Lipschitz神经网络是否比标准深度网络产生更稳定、更具泛化能力的解释?
- RQ4在使用有界Lipschitz常数的架构时,解释质量是否可测量地得到提升?
- RQ5MeGe和ReCo在多大程度上与人类可解释性和模型可靠性相关?
主要发现
- 在所有可解释性方法中,1-Lipschitz网络的平均泛化能力(MeGe)得分显著高于标准ResNet-18模型,其中Grad-CAM++的MeGe从0.58提升至0.72。
- 1-Lipschitz模型的相对一致性(ReCo)得分明显改善,Grad-CAM++的ReCo从0.11提升至0.60,SmoothGrad的ReCo从0.15提升至0.90。
- MeGe和ReCo的提升在多种可解释性方法(包括Grad-CAM、SmoothGrad和Integrated Gradients)中保持一致,表明其具有广泛的架构优势。
- 直方图分析显示,1-Lipschitz模型中S=与S≠分布的分离更清晰,直观证实了其一致性与泛化能力的增强。
- 尽管准确率相近(78±4%),1-Lipschitz网络仍能产生更稳定、更可信的解释,表明架构约束可在不依赖性能的情况下提升可解释性。
- 仅靠保真度不足以确保可信的解释,因为高保真度方法仍可能产生不稳定或非泛化的解释。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。