[论文解读] A Note about: Local Explanation Methods for Deep Neural Networks lack Sensitivity to Parameter Values
本文挑战了集成梯度(IG)对深度神经网络参数缺乏敏感性的说法,表明Adebayo等人(2018年)观察到随机网络与训练网络之间解释结果高度相关,是由于两个人为因素所致:(1)通过绝对值进行归一化,导致斯皮尔曼等级相关系数因黑色MNIST像素上的共享零归因而被夸大;(2)包含了归因为零的基线像素。当这些人为因素被纠正后,随机网络与训练网络的IG解释结果变得不相关,从而证明IG在正确评估下确实对参数值敏感。
Local explanation methods, also known as attribution methods, attribute a deep network's prediction to its input (cf. Baehrens et al. (2010)). We respond to the claim from Adebayo et al. (2018) that local explanation methods lack sensitivity, i.e., DNNs with randomly-initialized weights produce explanations that are both visually and quantitatively similar to those produced by DNNs with learned weights. Further investigation reveals that their findings are due to two choices in their analysis: (a) ignoring the signs of the attributions; and (b) for integrated gradients (IG), including pixels in their analysis that have zero attributions by choice of the baseline (an auxiliary input relative to which the attributions are computed). When both factors are accounted for, IG attributions for a random network and the actual network are uncorrelated. Our investigation also sheds light on how these issues affect visualizations, although we note that more work is needed to understand how viewers interpret the difference between the random and the actual attributions.
研究动机与目标
- 挑战局部解释方法(如集成梯度)对神经网络参数缺乏敏感性的说法。
- 识别并纠正Adebayo等人(2018年)在MNIST数据集上对集成梯度评估中的方法论缺陷。
- 证明当使用适当的评估指标时,集成梯度对网络参数是敏感的。
- 揭示归一化和基线选择如何扭曲归因方法的视觉与定量评估。
- 倡导在可解释性研究中采用更谨慎的可视化与评估实践。
提出的方法
- 重新评估训练网络与随机初始化网络之间集成梯度的斯皮尔曼等级相关性,考虑黑色像素上共享的零归因。
- 提出一种改进的相关性度量方法spearman_nz,通过排除归因为零的像素以消除虚假相关性。
- 在可视化中保留集成梯度的符号,以揭示参数敏感性,而非使用绝对值。
- 分析所有像素上集成梯度得分的总和,以追踪模型预测与基线之间差异的变化。
- 使用黑色图像作为基线,导致所有黑色像素获得零归因,这是原始分析中存在缺陷的关键因素。
- 通过级联方式随机化网络层,使用50张MNIST图像进行平均,实证测量相关性趋势。
实验结果
研究问题
- RQ1为何Adebayo等人(2018年)在训练网络与随机初始化网络的集成梯度之间观察到较高的斯皮尔曼相关性?
- RQ2通过绝对值进行归一化如何影响对归因方法敏感性的解释?
- RQ3MNIST图像中黑色像素上共享的零归因在多大程度上扭曲了相关性度量?
- RQ4当网络参数被随机化时,集成梯度值的符号如何变化?
- RQ5基线选择与归一化对归因图的视觉保真度有何影响?
主要发现
- Adebayo等人(2018年)报告的高斯皮尔曼相关性在很大程度上是由于通过绝对值对归因进行归一化所致,这导致因黑色MNIST像素上的共享零归因而被夸大。
- 当使用spearman_nz度量排除零归因像素后,训练网络与随机初始化网络之间集成梯度的相关性降至约0.424,表明二者无显著相似性。
- 集成梯度值的符号对网络参数极为敏感,可视化结果表明在随机化过程中像素归因从正变为负。
- 保留符号的可视化结果表明,原始网络突出显示了完整的笔画,而随机化网络则产生零散且不连贯的模式。
- 随着网络参数被随机化,所有像素上集成梯度得分的总和显著下降,趋近于零,表明与基线的预测差异丧失。
- 在不使用绝对值归一化的情况下,训练网络与随机网络之间解释结果的斯皮尔曼相关性降至0.0,证实归一化是导致误导性结果的核心原因。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。