Skip to main content
QUICK REVIEW

[论文解读] ODAM: Gradient-based instance-specific visual explanations for object detection

Chenyang Zhao, Antoni B. Chan|arXiv (Cornell University)|Apr 13, 2023
Explainable Artificial Intelligence (XAI)被引用 4
一句话总结

ODAM 是一种基于梯度的、针对实例的视觉解释方法,适用于目标检测器,可为单阶段和双阶段检测器中的单个目标预测生成高质量、抗噪声的激活图。它通过一种新颖的训练方案(Odam-Train)提升目标判别能力,并实现更优的非极大值抑制(Odam-NMS),在拥挤数据集上优于当前最先进方法,在准确性和鲁棒性方面表现更优。

ABSTRACT

We propose the gradient-weighted Object Detector Activation Maps (ODAM), a visualized explanation technique for interpreting the predictions of object detectors. Utilizing the gradients of detector targets flowing into the intermediate feature maps, ODAM produces heat maps that show the influence of regions on the detector's decision for each predicted attribute. Compared to previous works classification activation maps (CAM), ODAM generates instance-specific explanations rather than class-specific ones. We show that ODAM is applicable to both one-stage detectors and two-stage detectors with different types of detector backbones and heads, and produces higher-quality visual explanations than the state-of-the-art both effectively and efficiently. We next propose a training scheme, Odam-Train, to improve the explanation ability on object discrimination of the detector through encouraging consistency between explanations for detections on the same object, and distinct explanations for detections on different objects. Based on the heat maps produced by ODAM with Odam-Train, we propose Odam-NMS, which considers the information of the model's explanation for each prediction to distinguish the duplicate detected objects. We present a detailed analysis of the visualized explanations of detectors and carry out extensive experiments to validate the effectiveness of the proposed ODAM.

研究动机与目标

  • 为解决目标检测中缺乏实例特定视觉解释的问题,现有方法如 Grad-CAM 生成的是类别特定的激活图,会突出显示同一类别的所有目标。
  • 克服基于扰动的方法(如 D-RISE)计算效率低下且输出噪声多的问题,这些方法需要大量前向推理过程,并依赖掩码分辨率。
  • 通过解释单个预测属性(如类别和边界框坐标)而非仅分类结果,提升模型可解释性。
  • 通过训练检测器使其对同一目标产生一致的解释、对不同目标产生不同的解释,从而在解释中增强目标判别能力。
  • 利用实例级别的解释来改进非极大值抑制(NMS),特别是在存在重叠检测的拥挤场景中。

提出的方法

  • ODAM 通过将每个预测属性(如类别得分、边界框坐标)的梯度反向传播至中间特征图,计算加权梯度激活图,生成实例特定的热力图。
  • 该方法对特征图应用基于梯度的归因,类似于 Grad-CAM,但针对目标检测任务进行了适配,实现对每个预测实例的影响定位,而非对每个类别。
  • Odam-Train 引入了一种一致性损失,以鼓励对同一目标在多个检测中产生相似的解释,同时引入分离损失,确保不同目标的解释具有差异性。
  • 该训练方案在不修改检测器架构的前提下,提升了解释图的定位精度和判别能力。
  • Odam-NMS 利用 ODAM 生成的实例级热力图指导 NMS,优先保留解释更局部化且更独特的检测结果,以抑制重复检测。
  • 该方法具有通用性,兼容单阶段检测器(如 FCOS)、双阶段检测器(如 Faster R-CNN),以及多种主干网络和头结构。

实验结果

研究问题

  • RQ1基于梯度的归因能否为目标检测器生成实例特定的视觉解释,而非仅类别特定的解释?
  • RQ2如何修改模型训练方式,以提升对单个目标实例的视觉解释的忠实度和判别能力?
  • RQ3ODAM 生成的实例级解释能否提升在存在重叠目标的拥挤场景中 NMS 的性能?
  • RQ4在解释质量、效率和对目标尺寸鲁棒性方面,ODAM 与当前最先进方法(如 D-RISE 和 Grad-CAM)相比表现如何?
  • RQ5解释忠实度与目标判别能力之间的权衡是什么?如何有效管理这一权衡?

主要发现

  • 与 D-RISE 和 Grad-CAM 相比,ODAM 生成的热力图质量更高、噪声更少,定位更准确,且对目标尺寸变化更具鲁棒性,定性对比结果已验证此结论。
  • Odam-Train 显著提升了解释的定位精度和目标判别能力,减少了相似目标之间的混淆,并增强了对同一目标的解释一致性。
  • 在 CrowdHuman 数据集上,Odam-NMS 在 FCOS 模型中实现了最高的 Jaccard 指数(81.1)和最低的漏检率(44.5),优于 NMS、Soft-NMS 和 FeatureNMS 等所有 NMS 变体。
  • 对于 Faster R-CNN,Odam-NMS 达到了最高的平均精度(88.1)和最低的漏检率(42.8),在拥挤场景中表现出卓越性能。
  • 尽管由于热力图生成导致推理时间略有增加,Odam-NMS 仍保持了良好的推理速度,并在 NMS 的准确性和鲁棒性之间实现了最佳平衡。
  • 结果证实,ODAM 生成的实例级解释可有效引导 NMS,验证了所提方法在可解释性和实用性方面的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。