Skip to main content
QUICK REVIEW

[论文解读] Guided Zoom: Questioning Network Evidence for Fine-grained Classification

Sarah Adel Bargal, Andrea Zunino|arXiv (Cornell University)|Dec 6, 2018
Explainable Artificial Intelligence (XAI)参考文献 37被引用 15
一句话总结

Guided Zoom 通过利用空间证据一致性来优化 top-k 预测,从而提升细粒度图像分类的性能,确保模型决策与训练数据保持一致。该方法在 CUB-200-2011、Stanford Dogs 和 FGVC-Aircraft 数据集上实现了最先进(SOTA)的准确率,其核心是将测试时的证据与一组正确分类的训练样本作为参考池进行对比。

ABSTRACT

We propose Guided Zoom, an approach that utilizes spatial grounding of a model's decision to make more informed predictions. It does so by making sure the model has "the right reasons" for a prediction, defined as reasons that are coherent with those used to make similar correct decisions at training time. The reason/evidence upon which a deep convolutional neural network makes a prediction is defined to be the spatial grounding, in the pixel space, for a specific class conditional probability in the model output. Guided Zoom examines how reasonable such evidence is for each of the top-k predicted classes, rather than solely trusting the top-1 prediction. We show that Guided Zoom improves the classification accuracy of a deep convolutional neural network model and obtains state-of-the-art results on three fine-grained classification benchmark datasets.

研究动机与目标

  • 解决深度卷积神经网络在细粒度分类任务中预测可靠性的问题,其中细微的视觉差异常导致模型错误。
  • 克服仅依赖 top-1 预测的局限性,因为这类预测可能受到数据集偏差或伪影的影响。
  • 通过评估预测所依赖的视觉证据(空间定位)是否与正确分类的训练样本一致,来提升分类准确率。
  • 开发一种通用的、事后处理的框架,可增强任意预训练的 CNN 模型,且无需部件标注或注意力模块。
  • 通过学习的证据卷积神经网络模块,比较 top-k 预测类别之间的证据一致性,实现决策优化。

提出的方法

  • 将证据定义为模型输出中对应于某一类条件概率的空间局部激活图(以像素空间表示)。
  • 通过迭代对抗性擦除方法,从正确分类的训练图像中提取显著且具有判别性的区域,构建 (证据, 预测) 对的参考池。
  • 训练一个证据卷积神经网络,用于度量测试图像的证据与参考池中对应 top-k 预测类别的证据之间的一致性。
  • 利用证据卷积神经网络的输出,通过选择与训练参考池中证据最一致的 top-k 类别,来优化最终预测结果。
  • 在推理阶段将该框架应用于任意预训练的 CNN 模型,实现无需微调或结构修改的决策优化。
  • 通过提取并评估多个 top-k 类别的显著证据,实现多倍 zooming,从而提升相比单倍 zooming 方法的鲁棒性。

实验结果

研究问题

  • RQ1我们能否通过验证模型视觉证据的合理性,而非完全信任 top-1 预测,来提升细粒度分类的准确率?
  • RQ2与训练数据中证据的一致性在多大程度上影响细粒度识别任务中的预测可靠性?
  • RQ3一种通用的、事后处理的框架是否能无需部件标注或注意力模块,有效增强任意预训练的 CNN 模型?
  • RQ4通过 top-k 类别间证据一致性进行预测优化,是否优于标准的 top-1 推理方法?
  • RQ5与单倍 zooming 或基于注意力的方法相比,对显著证据进行多倍 zooming 在性能提升方面有多大优势?

主要发现

  • 在 CUB-200-2011 数据集上,Guided Zoom 将 top-1 准确率从 82.3% 提升至使用 top-3 预测时的 85.0%,使用 top-5 预测时达到 85.4%。
  • 在 Stanford Dogs 数据集上,Guided Zoom 将 top-1 准确率从 86.9% 提升至使用 top-3 预测时的 88.4%,使用 top-5 预测时达到 88.5%。
  • 在 FGVC-Aircraft 数据集上,Guided Zoom 将 top-1 准确率从 87.5% 提升至使用 top-3 或 top-5 预测时的 89.1%。
  • 当应用于 MA-CNN 模型时,Guided Zoom 在 FGVC-Aircraft 数据集上实现了 90.7% 的 top-1 准确率,创下新的最先进水平。
  • Guided Zoom 在所有三个基准数据集上均优于 RA-CNN 及其他弱监督方法,证明了多倍 zooming 和证据一致性的有效性。
  • 该框架具有通用性且效果显著,即使在未使用注意力模块训练的模型上也表现良好,展现出广泛适用性和鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。