Skip to main content
QUICK REVIEW

[论文解读] Improving Deep Learning Interpretability by Saliency Guided Training

Aya Abdelsalam Ismail, Héctor Corrada Bravo|arXiv (Cornell University)|Nov 29, 2021
Explainable Artificial Intelligence (XAI)被引用 10
一句话总结

本文提出显著性引导训练(saliency guided training),一种新颖的训练方法,通过在训练过程中迭代屏蔽低梯度特征来减少深度神经网络中的噪声梯度,同时保持模型性能。通过最小化在屏蔽输入与原始输入上预测结果之间的KL散度,该方法在视觉、自然语言处理(NLP)和时间序列任务中均生成了更稀疏、更忠实的显著性图,且不损失准确性。

ABSTRACT

Saliency methods have been widely used to highlight important input features in model predictions. Most existing methods use backpropagation on a modified gradient function to generate saliency maps. Thus, noisy gradients can result in unfaithful feature attributions. In this paper, we tackle this issue and introduce a {\it saliency guided training}procedure for neural networks to reduce noisy gradients used in predictions while retaining the predictive performance of the model. Our saliency guided training procedure iteratively masks features with small and potentially noisy gradients while maximizing the similarity of model outputs for both masked and unmasked inputs. We apply the saliency guided training procedure to various synthetic and real data sets from computer vision, natural language processing, and time series across diverse neural architectures, including Recurrent Neural Networks, Convolutional Networks, and Transformers. Through qualitative and quantitative evaluations, we show that saliency guided training procedure significantly improves model interpretability across various domains while preserving its predictive performance.

研究动机与目标

  • 解决深度学习中显著性图噪声大且不可靠的问题,该问题在医学和自动驾驶等关键领域阻碍了模型的可解释性。
  • 克服现有显著性方法依赖反向传播产生的噪声梯度的局限性,尤其是在梯度消失问题影响解释质量的RNN等模型中。
  • 开发一种训练过程,能内在地生成更清晰、更可靠的显著性图,而无需依赖真实解释或事后修正。
  • 在保持预测性能的同时,提升CNN、RNN、Transformer和TCN等多种架构的可解释性。
  • 通过使用所提出框架进行训练后,利用标准显著性方法在图像、文本和多变量时间序列等不同数据模态上展示泛化能力。

提出的方法

  • 在训练过程中迭代屏蔽梯度幅值较低的输入特征(即不重要的特征),以减少基于梯度的显著性图中的噪声。
  • 优化包含标准预测损失和原始输入与屏蔽输入上模型输出之间KL散度的联合损失函数。
  • 在屏蔽过程中使用普通梯度进行特征选择,但可在训练后提升多种显著性方法(如Integrated Gradients、DeepLIFT、DeepSHAP)的可解释性。
  • 使用随机梯度下降进行端到端训练,每轮训练步骤根据梯度幅值阈值应用屏蔽。
  • 通过超参数λ(正则化强度)和k(屏蔽特征比例)控制屏蔽程度,实现稀疏性与性能之间的权衡。
  • 在多种架构上应用该方法:CNN用于图像分类,RNN用于序列数据,Transformer用于自然语言处理(NLP),TCN用于时间序列。

实验结果

研究问题

  • RQ1能否设计一种训练过程,内在地减少显著性图中的梯度噪声,而无需依赖事后平滑或高阶梯度计算?
  • RQ2显著性引导训练是否能在包括图像、文本和时间序列在内的不同数据模态中,提升显著性图的忠实度与稀疏性?
  • RQ3该方法在多大程度上缓解了RNN中的梯度消失问题,该问题常导致解释信息量不足?
  • RQ4显著性引导训练的优势是否可泛化至多种显著性方法(如Integrated Gradients和DeepSHAP),而无需重新训练?
  • RQ5该方法在显著提升可解释性指标(如事实抽取和情感分析任务中的AUP和AUR)的同时,是否保持了预测性能?

主要发现

  • 在图像分类任务中,显著性引导训练减少了视觉显著性图的噪声,并生成了更稀疏、更具可解释性的显著性图,如定性对比所示。
  • 在情感分析和事实抽取任务中,该方法提升了解释的全面性,多种显著性方法在AUP和AUR指标上均取得显著提升。
  • 在多变量时间序列分类任务中,该方法同时提高了显著性图的精确率与召回率,其中DeepSHAP和Integrated Gradients在结合该方法后表现最佳。
  • 该方法有效缓解了RNN中的梯度消失问题,表现为在序列任务中梯度归因更加一致且具有意义。
  • 当与显著性引导训练结合时,Integrated Gradients和DeepSHAP在RareFeature数据集上实现了最佳精确率(0.239 AUP),而Integrated Gradients和DeepLift则展现出最佳召回率。
  • 在Transformer模型上,尽管传统训练在Gradient SHAP上获得了更高的精确率,但显著性引导训练显著提升了所有显著性方法的召回率,其中Integrated Gradients在Moving Rare Feature数据集上达到最高召回率(0.171 AUR)。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。