Skip to main content
QUICK REVIEW

[论文解读] Trustworthy Convolutional Neural Networks: A Gradient Penalized-based Approach

Nicholas Halliwell, Freddy Lécué|arXiv (Cornell University)|Sep 29, 2020
Explainable Artificial Intelligence (XAI)参考文献 40被引用 9
一句话总结

该论文提出了一种梯度惩罚损失函数,通过在训练过程中惩罚不准确的显著性图,以训练可信赖的卷积神经网络,从而同时提升分类准确率和可解释性。该方法通过使模型参数与人类直观的显著性图对齐,增强模型可信度,提高用户参与度,并减少对黑箱预测的依赖。

ABSTRACT

Convolutional neural networks (CNNs) are commonly used for image classification. Saliency methods are examples of approaches that can be used to interpret CNNs post hoc, identifying the most relevant pixels for a prediction following the gradients flow. Even though CNNs can correctly classify images, the underlying saliency maps could be erroneous in many cases. This can result in skepticism as to the validity of the model or its interpretation. We propose a novel approach for training trustworthy CNNs by penalizing parameter choices that result in inaccurate saliency maps generated during training. We add a penalty term for inaccurate saliency maps produced when the predicted label is correct, a penalty term for accurate saliency maps produced when the predicted label is incorrect, and a regularization term penalizing overly confident saliency maps. Experiments show increased classification performance, user engagement, and trust.

研究动机与目标

  • 解决由于不准确的显著性图导致用户对CNN缺乏信任的问题,即使预测正确也会误导用户。
  • 开发一种训练目标,通过显著性图强制实现模型预测与事后可解释性的一致性。
  • 通过惩罚产生误导性或过度自信的显著性图的参数选择,提升模型透明度。
  • 在不进行完整微调的情况下,支持预训练模型的微调和迁移学习,以增强可解释性。

提出的方法

  • 引入一种多组件损失函数,结合交叉熵与三项惩罚项:预测正确时的不准确显著性图、预测错误时的准确显著性图,以及过度自信的显著性图。
  • 在前向传播过程中使用Grad-CAM和Guided Grad-CAM计算显著性图,从而实现对可解释性的基于梯度的优化。
  • 通过计算显著性图相对于模型参数的梯度来应用惩罚项,使可解释性机制能够反向传播。
  • 引入正则化项,惩罚具有高方差或过度自信的显著性图,以促进稳健且稳定的解释。
  • 通过将损失函数集成到现有训练流程中,支持预训练模型的微调和迁移学习。
  • 使用结构相似性(SSIM)作为评估显著性图准确性的指标,将预测图与真实标签进行比较。

实验结果

研究问题

  • RQ1能否设计一种训练目标,同时提升分类准确率和显著性图保真度?
  • RQ2在训练过程中惩罚不准确的显著性图,对模型可信度和用户感知有何影响?
  • RQ3所提出的损失函数在多大程度上减少了正确预测但显著性图具有误导性的现象(情况3)?
  • RQ4引入显著性图正则化是否能提升模型对对抗性或模糊输入的鲁棒性?
  • RQ5该方法是否能在不损害性能的前提下,有效应用于迁移学习场景?

主要发现

  • 使用Grad-CAM训练的可信CNN中,44%的图像实现了正确预测与准确显著性图的匹配,显著优于基线模型VGG-16的22%。
  • 使用Guided Grad-CAM训练的模型将错误预测但显著性图准确的情况(情况2)降低至8%,而基线模型为12%。
  • 该方法将正确预测但显著性图不准确的情况(情况3)降低至使用Grad-CAM时的18%,使用Guided Grad-CAM时为10%,而基线模型为48%。
  • 用户研究证实,使用所提损失函数训练的模型显著提升了用户信任度和参与度,尤其在显著性图与人类直觉一致时更为明显。
  • 消融实验证明,若禁用显著性图惩罚项,性能显著下降,证实了其在损失函数中的必要性。
  • 该方法在两项显著性相关惩罚项之间表现出权衡关系,如在移除某项后SSIM的变化所示。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。