[论文解读] XRAI: Better Attributions Through Regions
XRAI 是一种新颖的基于区域的归因方法,通过迭代识别并合并最重要的图像区域,利用积分梯度改进显著性图。它在 ImageNet 上的表现优于现有方法,弱监督定位任务中 AUC(0.836)和 F1(0.786)均更高,并引入了性能信息曲线(PICs)和基于扰动的合理性检验,以实现稳健的评估。
Saliency methods can aid understanding of deep neural networks. Recent years have witnessed many improvements to saliency methods, as well as new ways for evaluating them. In this paper, we 1) present a novel region-based attribution method, XRAI, that builds upon integrated gradients (Sundararajan et al. 2017), 2) introduce evaluation methods for empirically assessing the quality of image-based saliency maps (Performance Information Curves (PICs)), and 3) contribute an axiom-based sanity check for attribution methods. Through empirical experiments and example results, we show that XRAI produces better results than other saliency methods for common models and the ImageNet dataset.
研究动机与目标
- 开发一种更准确且鲁棒的显著性方法,以识别影响深度学习预测的语义上合理的图像区域。
- 解决像素级归因方法的局限性,例如输出颗粒感强以及在包含多个物体的复杂场景中泛化能力差的问题。
- 提出一种与视觉直觉和标准定位指标对齐的新评估框架。
- 提供一种合理性检验,验证归因方法在输入扰动导致输出显著变化时是否能正确响应。
- 证明基于区域的归因相比像素级方法能提供更可靠、更具可解释性的解释。
提出的方法
- XRAI 首先使用相似性度量(例如颜色)将输入图像过分割为超像素。
- 对每个区域计算积分梯度归因,并根据其对预测的重要性进行排序。
- 通过逐步合并得分最高的区域,增量式地扩展显著性区域,形成边界紧密、语义一致的区域。
- 采用基于扰动的合理性检验,验证当输入扰动引起输出变化时,归因值是否非零。
- 通过逐步增强最显著区域,测量模型性能和图像熵(通过 WebP 压缩实现),构建性能信息曲线(PICs)。
- 引入两种度量——准确率信息曲线(AICs)和 Softmax 信息曲线(SICs),通过测量预测准确率和 Softmax 置信度随信息量变化的情况,评估显著性质量。
实验结果
研究问题
- RQ1基于区域的归因方法是否能产生比像素级方法(如积分梯度)更准确、更具可解释性的显著性图?
- RQ2当使用一种衡量预测能力随信息量变化的新度量时,不同显著性方法的表现如何?
- RQ3当扰动导致显著输出变化但归因值为零时,现有显著性方法是否会在基本合理性检验中失败?
- RQ4所提出的评估框架(PICs)是否能与视觉检查和标准定位指标一致地对显著性方法进行可靠排序?
- RQ5与倾向于关注单一中心或圆形区域的 GradCAM 等方法相比,XRAI 的区域增长策略是否能更好地定位复杂图像中的多个物体?
主要发现
- 在 ImageNet 分割数据集上,XRAI 的 AUC 达到 0.836,F1 达到 0.786,显著优于 GradCAM(AUC 0.742,F1 0.715)和积分梯度变体。
- 在 SIC 度量下,XRAI 在 ResNet50-V2 上的曲线下方面积达到 0.749,在 Inception 上达到 0.720,优于所有其他方法,包括使用不同基线的 GradCAM 和 IG。
- 基于扰动的合理性检验表明,梯度法、梯度×输入法以及积分梯度法在敏感特征引起显著输出变化但归因值为零时可能失效。
- 如图 1 所示,XRAI 的区域级归因比像素级 IG 更具鲁棒性,其中梯度值总和接近零的高梯度区域被正确排除。
- 性能信息曲线(PICs)显示了视觉显著性质量与定量排序之间的一致性,验证了该框架的有效性。
- 视觉对比表明,XRAI 能够以边界紧密、不重叠的区域更好地定位多个物体(例如鸟类、狗),而 GradCAM 倾向于聚焦于中心或圆形区域。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。