Skip to main content
QUICK REVIEW

[论文解读] Analyzing Effects of Mixed Sample Data Augmentation on Model Interpretability

Soyoun Won, Sung‐Ho Bae|arXiv (Cornell University)|Mar 26, 2023
Explainable Artificial Intelligence (XAI)Computer Science被引用 3
一句话总结

本文研究了混合样本数据增强对深度神经网络可解释性的影响,提出了三项评估标准:与人类判断的一致性、模型忠实度以及解耦概念检测。研究发现,尽管CutMix和SaliencyMix提升了性能,但其可解释性反而下降,提示在医疗AI等关键任务应用中需谨慎使用。

ABSTRACT

Mixed sample data augmentation strategies are actively used when training deep neural networks (DNNs). Recent studies suggest that they are effective at various tasks. However, the impact of mixed sample data augmentation on model interpretability has not been widely studied. In this paper, we explore the relationship between model interpretability and mixed sample data augmentation, specifically in terms of feature attribution maps. To this end, we introduce a new metric that allows a comparison of model interpretability while minimizing the impact of occlusion robustness of the model. Experimental results show that several mixed sample data augmentation decreases the interpretability of the model and label mixing during data augmentation plays a significant role in this effect. This new finding suggests it is important to carefully adopt the mixed sample data augmentation method, particularly in applications where attribution map-based interpretability is important.

研究动机与目标

  • 探究混合样本数据增强对深度神经网络可解释性影响的未被探索的效应。
  • 解决缺乏用于比较不同增强策略训练下模型可解释性的度量标准的问题。
  • 通过与人类标注边界框的一致性、忠实度以及模型内部可检测的解耦概念,评估可解释性。
  • 提供一种定量框架,用于跨模型的可解释性比较,补充现有以方法为中心的度量标准。
  • 为实践者提供指导,选择在性能与可解释性之间取得平衡的数据增强策略,特别是在安全关键领域。

提出的方法

  • 提出新的跨模型可解释性评估度量:跨模型删除与跨模型插入,实现不同模型间的可比性。
  • 采用三项标准评估模型可解释性:(1) 归因图中与人类标注边界框的一致性,(2) 通过删除/插入分数衡量的忠实度,(3) 可检测的解耦对象概念数量。
  • 在ImageNet上使用Cutout、Mixup、CutMix和SaliencyMix训练ResNet-50,以实现受控比较。
  • 利用概念激活理论(CAM)和目标检测器分析,量化模型特征的解耦程度。
  • 在SaliencyMix中应用显著性引导的补丁选择,优先在混合过程中选择语义相关的区域。
  • 通过消融研究,比较不同增强方法在归因图稀疏性、定位准确性和概念检测器数量方面的表现。

实验结果

研究问题

  • RQ1混合样本数据增强如何影响模型归因图与人类标注真实值之间的一致性?
  • RQ2数据增强在多大程度上影响后处理解释中特征归因方法的忠实度?
  • RQ3混合样本增强是否会减少模型激活中可检测的解耦概念数量?
  • RQ4在使用CutMix和SaliencyMix时,模型性能与可解释性之间是否存在权衡?
  • RQ5能否通过基于删除/插入的度量标准,对不同增强策略下的跨模型可解释性进行定量测量与比较?

主要发现

  • 使用CutMix和SaliencyMix训练的模型,在归因图中与人类标注边界框的一致性显著低于其他增强方法。
  • 跨模型删除与插入分数表明,CutMix和SaliencyMix训练模型的归因图对模型实际决策过程的忠实度较低。
  • 尽管SaliencyMix在ImageNet上实现了最先进性能(Top-1错误率21.26%),但其可检测的解耦对象概念数量最少。
  • 与基线模型相比,CutMix和SaliencyMix使唯一对象检测器数量减少高达30%,表明特征解耦能力更差。
  • 所有三项评估标准均表明,混合样本增强带来的性能提升并未转化为可解释性的改善。
  • 样本混合引起的数据分布变化似乎阻碍了能够检测到独立、人类可识别概念的神经元的出现。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。