Skip to main content
QUICK REVIEW

[论文解读] Attention-based Dropout Layer for Weakly Supervised Object Localization

Junsuk Choe, Hyunjung Shim|arXiv (Cornell University)|Aug 27, 2019
Advanced Neural Network Applications参考文献 59被引用 22
一句话总结

本文提出了一种基于注意力的丢弃层(ADL),用于弱监督目标定位(WSOL),通过自注意力机制在训练过程中动态识别并抑制对象中最具有判别性的部分,从而促使模型学习到完整的对象范围。ADL在CUB-200-2011数据集上实现了最先进性能,相较于先前方法准确率提升超过15个百分点,同时保持了较低的计算和参数开销。

ABSTRACT

Weakly Supervised Object Localization (WSOL) techniques learn the object location only using image-level labels, without location annotations. A common limitation for these techniques is that they cover only the most discriminative part of the object, not the entire object. To address this problem, we propose an Attention-based Dropout Layer (ADL), which utilizes the self-attention mechanism to process the feature maps of the model. The proposed method is composed of two key components: 1) hiding the most discriminative part from the model for capturing the integral extent of object, and 2) highlighting the informative region for improving the recognition power of the model. Based on extensive experiments, we demonstrate that the proposed method is effective to improve the accuracy of WSOL, achieving a new state-of-the-art localization accuracy in CUB-200-2011 dataset. We also show that the proposed method is much more efficient in terms of both parameter and computation overheads than existing techniques.

研究动机与目标

  • 解决弱监督目标定位(WSOL)中模型仅关注对象最具有判别性的部分而非完整范围的局限性。
  • 开发一种轻量化、高效的模型,促使模型学习对象中判别性较低但关键的部分,而无需多次前向传播或额外分类器。
  • 通过自注意力机制在训练过程中生成动态丢弃掩码和重要性图,提升定位准确率。
  • 实现对不同CNN架构的广泛适用性,且无需修改网络结构。

提出的方法

  • ADL对输入特征图进行通道维度的平均池化,生成反映通道激活强度的自注意力图。
  • 从自注意力图中通过阈值化生成丢弃掩码,以在训练过程中识别并抑制最具判别性的区域。
  • 利用Sigmoid激活函数对自注意力图生成重要性图,以突出信息丰富的区域并改善特征表示。
  • 在训练过程中,通过空间维度的逐元素乘法,随机选择应用丢弃掩码或重要性图到输入特征图。
  • 该方法具有可微性,且无需额外可学习参数,因此轻量化且可与任意CNN主干网络兼容。
  • ADL仅在训练阶段应用;推理时模型行为与标准分类器一致,可轻松集成到现有WSOL流程中。

实验结果

研究问题

  • RQ1在弱监督设置下,能否利用自注意力机制动态识别并抑制对象中最具有判别性的部分?
  • RQ2通过可学习的注意力掩码抑制最具判别性的区域,是否能提升对完整对象范围的定位性能?
  • RQ3与现有SOTA方法相比,该方法能否在显著更低的计算和参数开销下实现SOTA性能?
  • RQ4为何ADL在CUB-200-2011上表现优于ImageNet-1k,尽管模型架构相似?

主要发现

  • ADL在CUB-200-2011数据集上实现了新的SOTA定位准确率,相较于先前方法性能提升超过15个百分点。
  • 在ImageNet-1k上,ADL的准确率与当前SOTA方法[60]相当,但所需计算资源显著更少。
  • 当使用ResNet50-SE作为主干网络时,ADL在准确率上优于ACoL,并与SPG持平,同时计算量大幅降低。
  • 由于仅需一次前向-反向传播且无额外可学习参数,ADL保持了卓越的效率,参数和计算开销极低。
  • 该方法在多种主干网络上均表现有效,包括InceptionV3,在ImageNet-1k上与SPG的准确率差异仅为0.11个百分点。
  • 在ImageNet-1k上的失败案例表明,ADL可能意外学习到与对象共现的背景特征,这些特征判别性较低但频繁出现,表明在复杂背景中存在局限性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。