Skip to main content
QUICK REVIEW

[论文解读] A Simple Interpretable Transformer for Fine-Grained Image Classification and Analysis

Dipanjyoti Paul, Arpita Chowdhury|arXiv (Cornell University)|Nov 7, 2023
Cell Image Analysis Techniques被引用 5
一句话总结

本文提出 INTR,一种用于细粒度图像分类的简单且可解释的 Transformer 模型,通过解码器中的类别特定查询,利用交叉注意力机制定位区分性图像属性。通过为每个类别学习一个查询,INTR 实现了基于注意力的预测忠实解释,在八个细粒度数据集上达到最先进性能,同时揭示了细微的视觉模式,包括与生物学观察一致的模式。

ABSTRACT

We present a novel usage of Transformers to make image classification interpretable. Unlike mainstream classifiers that wait until the last fully connected layer to incorporate class information to make predictions, we investigate a proactive approach, asking each class to search for itself in an image. We realize this idea via a Transformer encoder-decoder inspired by DEtection TRansformer (DETR). We learn "class-specific" queries (one for each class) as input to the decoder, enabling each class to localize its patterns in an image via cross-attention. We name our approach INterpretable TRansformer (INTR), which is fairly easy to implement and exhibits several compelling properties. We show that INTR intrinsically encourages each class to attend distinctively; the cross-attention weights thus provide a faithful interpretation of the prediction. Interestingly, via "multi-head" cross-attention, INTR could identify different "attributes" of a class, making it particularly suitable for fine-grained classification and analysis, which we demonstrate on eight datasets. Our code and pre-trained models are publicly accessible at the Imageomics Institute GitHub site: https://github.com/Imageomics/INTR.

研究动机与目标

  • 解决标准深度学习模型在图像分类中缺乏内在可解释性的问题。
  • 使模型能够主动搜索图像中的类别特定模式,而非依赖事后注意力解释。
  • 开发一种方法,自然地生成无需辅助监督或复杂训练的忠实、类别特定的注意力图。
  • 验证模型在多样化细粒度视觉识别任务中的可解释性与泛化能力。
  • 证明多头交叉注意力能够学习识别视觉相似类别间的不同属性。

提出的方法

  • 模型使用标准的 Vision Transformer 编码器,从输入图像中提取分块特征。
  • 引入一个解码器,其中包含可学习的类别特定查询——每个类别一个,作为解码器的输入。
  • 类别特定查询与图像特征之间的交叉注意力,使每个类别能够关注图像中自身独特的模式。
  • 解码器内部的自注意力机制编码候选类别之间的上下文关系,以指导区分。
  • 最终预测通过将类别特定的图像特征(来自交叉注意力)与共享的类别无关向量进行点积计算得出。
  • 模型使用标准交叉熵损失端到端训练,推理时直接从交叉注意力权重中获得解释。

实验结果

研究问题

  • RQ1能否设计一种基于 Transformer 的模型,使每个类别主动搜索其自身的视觉模式,从而实现内在可解释性?
  • RQ2在解码器中使用类别特定查询是否能产生忠实、可解释的交叉注意力图,以突出显示区分性属性?
  • RQ3多头交叉注意力是否能一致地在不同图像中定位同一类别的不同语义属性?
  • RQ4该模型在细粒度分类任务中的表现如何,特别是在区分视觉相似类别时?
  • RQ5该模型的注意力对属性级别的图像操作在多大程度上敏感?

主要发现

  • INTR 在八个细粒度图像分类基准上实现了最先进或具有竞争力的准确率,包括 CUB-200-2011、Stanford Dogs 和 FGVC-Aircraft。
  • INTR 生成的交叉注意力图在所有数据集中一致地定位了区分性属性,如眼斑、翅膀图案和喙形。
  • 在测试视觉相似的物种(如 Heliconius melpomene 和 Heliconius elevatus)时,INTR 准确定位了与生物学注释一致的细微差异。
  • 该模型对属性级别的图像操作表现出高度敏感性:删除或添加关键属性会导致注意力图发生显著变化,证实注意力与视觉语义紧密相关。
  • 通过仅将输入查询限制在视觉相似的类别上,INTR 提升了检测细粒度差异的能力,表明其具备上下文感知的注意力学习能力。
  • 数学分析表明,最小化交叉熵损失会促使每个类别产生独特的交叉注意力模式,从而在无需额外设计的情况下确保忠实的解释。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。