[论文解读] Towards Robust Explanations for Deep Neural Networks
本文提出了一套统一的理论框架,以增强深度神经网络解释对输入级扰动的鲁棒性。通过在训练过程中整合权重衰减、类似Softplus的平滑ReLU激活函数以及海森矩阵范数最小化,作者显著降低了解释对微小输入扰动的敏感性,在CIFAR-10上实现了原始与扰动显著性图之间皮尔逊相关系数最高提升30%。
Explanation methods shed light on the decision process of black-box classifiers such as deep neural networks. But their usefulness can be compromised because they are susceptible to manipulations. With this work, we aim to enhance the resilience of explanations. We develop a unified theoretical framework for deriving bounds on the maximal manipulability of a model. Based on these theoretical insights, we present three different techniques to boost robustness against manipulation: training with weight decay, smoothing activation functions, and minimizing the Hessian of the network. Our experimental results confirm the effectiveness of these approaches.
研究动机与目标
- 解决深度学习解释对微小、难以察觉的输入扰动的脆弱性,这些扰动会显著改变解释图。
- 指出模型决策边界处的高曲率会增加解释被操纵的敏感性。
- 构建一个理论框架,以限制输入扰动下解释图的最大变化量。
- 提出并验证三种实用的训练技术,以增强解释鲁棒性,且不改变推理过程。
- 证明鲁棒解释在医疗和信贷评估等高风险领域中对可信人工智能至关重要。
提出的方法
- 推导一个统一的理论框架,将解释可操纵性与网络关于输入的海森矩阵联系起来,从而对最大解释变化量进行理论约束。
- 在训练过程中应用权重衰减,以降低模型曲率并稳定梯度,从而最小化输入噪声下的解释偏移。
- 用Softplus函数替代ReLU激活函数,以平滑不可导的尖点,降低对输入扰动的敏感性。
- 通过可微正则化项最小化训练数据点处网络的海森矩阵范数,直接使损失曲面在局部变平坦。
- 使用蒙特卡洛采样高效近似训练过程中的海森矩阵范数,实现可扩展的优化。
- 将上述三种技术整合到单一训练流程中,以在多种解释方法和噪声类型下最大化鲁棒性。
实验结果
研究问题
- RQ1在小幅度输入扰动下,解释图的最大变化量在理论上可被多大程度地约束?
- RQ2权重衰减、激活平滑和海森矩阵最小化分别在多大程度上影响显著性图的鲁棒性?
- RQ3同时应用多种鲁棒性技术时,对不同噪声分布下的解释稳定性有何综合影响?
- RQ4训练模型中,解释鲁棒性与海森矩阵范数及权重范数的减小之间存在何种相关性?
- RQ5所提出的训练方法是否能在显著提升对抗性输入扰动下解释一致性的同时,保持高分类准确率?
主要发现
- 所提出的理论框架成功地对输入扰动引起的解释图最大变化量进行了理论约束,为鲁棒性提供了原则性基础。
- 采用权重衰减训练可同时降低权重范数与海森矩阵范数,使在高斯噪声下解释相似性(以PCC衡量)提升25%。
- 使用β=10的Softplus激活平滑相比ReLU可将鲁棒性提升20%,尤其在拉普拉斯分布和高斯噪声下表现更优。
- 海森矩阵范数最小化带来了最强的鲁棒性增益,在CIFAR-10上与其它方法结合使用时,PCC最高可提升30%。
- 三种技术的联合使用可产生最稳定的解释,所有噪声水平和类型下的PCC值均稳定保持在0.95以上。
- 尽管盐椒噪声更具破坏性,但使用所提出的训练技术后,其鲁棒性仍显著提升,尤其在结合权重衰减与海森矩阵最小化时效果明显。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。