Skip to main content
QUICK REVIEW

[论文解读] Re-Attention Transformer for Weakly Supervised Object Localization

Hui Su, Ye Yue|arXiv (Cornell University)|Aug 3, 2022
Advanced Neural Network Applications被引用 6
一句话总结

本文提出了一种名为Token Refinement Transformer(TRT)的重新注意力机制,通过抑制背景噪声并利用类别激活图(CAM)精炼注意力图,从而提升弱监督目标定位的性能。TRT引入了Token优先级评分模块(TPSM)与自适应阈值化策略,在ILSVRC和CUB-200-2011基准上分别取得了82.08%和91.1%的定位准确率,达到当前最先进水平。

ABSTRACT

Weakly supervised object localization is a challenging task which aims to localize objects with coarse annotations such as image categories. Existing deep network approaches are mainly based on class activation map, which focuses on highlighting discriminative local region while ignoring the full object. In addition, the emerging transformer-based techniques constantly put a lot of emphasis on the backdrop that impedes the ability to identify complete objects. To address these issues, we present a re-attention mechanism termed token refinement transformer (TRT) that captures the object-level semantics to guide the localization well. Specifically, TRT introduces a novel module named token priority scoring module (TPSM) to suppress the effects of background noise while focusing on the target object. Then, we incorporate the class activation map as the semantically aware input to restrain the attention map to the target object. Extensive experiments on two benchmarks showcase the superiority of our proposed method against existing methods with image category annotations. Source code is available in \url{https://github.com/su-hui-zz/ReAttentionTransformer}.

研究动机与目标

  • 解决现有方法在弱监督下仅能定位判别性局部区域而非完整物体的局限性。
  • 减少视觉Transformer中因全局自注意力机制导致的背景干扰,即模型常关注无关区域的问题。
  • 通过将类别激活图(CAM)作为语义引导,提升注意力图的精炼效果,从而提高定位准确率。
  • 开发一种优于Top-K或固定阈值策略的更有效阈值化方法,以选择注意力图中的关键token。

提出的方法

  • 提出一种名为Token Refinement Transformer(TRT)的重新注意力机制,利用物体级别的语义信息对注意力图进行精炼。
  • 引入Token优先级评分模块(TPSM),根据token的响应强度与背景抑制程度重新评分注意力图中的token。
  • 将类别激活图(CAM)作为语义感知输入,约束注意力图聚焦于目标物体。
  • 采用基于累积分布函数采样的自适应阈值化策略,选择重要性更高的token,其性能优于固定阈值或Top-K策略。
  • 在视觉Transformer主干网络(如DeiT)中应用重新注意力模块,以在定位前精炼特征表示。
  • 使用图像级别标签进行端到端训练,利用注意力图预测边界框,无需边界框标注。

实验结果

研究问题

  • RQ1重新注意力机制能否通过精炼注意力图以抑制视觉Transformer中的背景噪声,从而提升目标定位性能?
  • RQ2将类别激活图作为语义引导整合到注意力图中,对弱监督定位中的注意力图质量有何影响?
  • RQ3基于累积重要性采样的自适应阈值化策略是否优于标准的Top-K或固定阈值策略,在token选择中表现更优?
  • RQ4所提出的TRT框架在ILSVRC与CUB-200-2011等标准基准上的定位准确率提升程度如何?
  • RQ5与现有方法相比,TRT框架是否能更有效地利用更大的视觉Transformer主干网络(如DeiT-B)?

主要发现

  • 在ILSVRC基准上,TRT实现了82.08%的定位准确率,优于先前的最先进方法。
  • 在CUB-200-2011数据集上,TRT达到了91.1%的Gt-Known定位准确率,显著优于此前SOTA方法的86.6%。
  • 所提出的基于累积分布采样策略的自适应阈值化方法,在性能上优于Top-K或固定阈值方法。
  • 消融实验表明,TPSM模块与自适应阈值化策略对性能至关重要,定性结果也显示注意力图更清晰、更聚焦于目标物体。
  • TRT在更大的主干网络(如DeiT-B)上仍保持优异性能,而部分现有方法在DeiT-B上性能反而低于DeiT-S。
  • 可视化结果表明,TRT生成的注意力图比基于CAM的方法或标准Transformer方法更具连贯性与物体一致性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。