Skip to main content
QUICK REVIEW

[论文解读] Localizing by Describing: Attribute-Guided Attention Localization for Fine-Grained Recognition

Xiao Liu, Jiang Wang|arXiv (Cornell University)|May 20, 2016
Advanced Neural Network Applications参考文献 16被引用 17
一句话总结

本文提出了一种用于细粒度图像识别的属性引导注意力定位框架,利用部件属性描述(例如“红色翅膀”)作为弱监督信号,通过强化学习训练多个全卷积注意力网络。通过设计一种新颖的奖励策略,模型能够比仅使用类别标签的监督方法更准确地定位语义和空间上独特的部件,在无需边界框标注的情况下,于CUB-200-2011数据集上实现了最先进(SOTA)的识别准确率。

ABSTRACT

A key challenge in fine-grained recognition is how to find and represent discriminative local regions. Recent attention models are capable of learning discriminative region localizers only from category labels with reinforcement learning. However, not utilizing any explicit part information, they are not able to accurately find multiple distinctive regions. In this work, we introduce an attribute-guided attention localization scheme where the local region localizers are learned under the guidance of part attribute descriptions. By designing a novel reward strategy, we are able to learn to locate regions that are spatially and semantically distinctive with reinforcement learning algorithm. The attribute labeling requirement of the scheme is more amenable than the accurate part location annotation required by traditional part-based fine-grained recognition methods. Experimental results on the CUB-200-2011 dataset demonstrate the superiority of the proposed scheme on both fine-grained recognition and attribute recognition.

研究动机与目标

  • 解决仅使用类别标签时弱监督方法难以定位多个判别性部件的局限性。
  • 通过利用部件属性描述作为比仅类别标签更丰富的监督信号,提升定位准确率。
  • 开发一种基于强化学习的框架,学习由属性预测引导的部件特定定位策略。
  • 在无需强监督信号(如边界框或部件位置标签)的情况下,实现最先进水平的细粒度识别性能。

提出的方法

  • 训练多个全卷积注意力定位网络,每个网络负责预测特定物体部件的属性。
  • 使用一种新颖的奖励函数,结合多标签属性预测损失与定位置信度,以指导强化学习。
  • 应用深度Q网络(DQN)学习定位策略,其中状态为输入图像,动作为需关注的空间区域。
  • 推理阶段,将局部化部件的特征与完整图像的特征拼接后输入分类器,进行最终类别预测。
  • 引入一种奖励策略,对高属性预测损失进行惩罚,并鼓励关注不确定性或错误较高的区域。
  • 采用多任务学习设置,通过共享图像特征,联合优化部件定位器与属性预测器。

实验结果

研究问题

  • RQ1部件属性描述能否作为有效的弱监督信号,以改善细粒度识别中判别性物体部件的定位?
  • RQ2与仅使用类别标签的监督相比,使用属性引导的注意力定位是否能带来更高的识别准确率?
  • RQ3通过新颖奖励函数的强化学习能否有效学习到对多个在空间和语义上均不同的部件进行定位?
  • RQ4与完全监督及其他弱监督基线方法相比,所提方法在定位准确率和识别性能方面表现如何?

主要发现

  • 在CUB-200-2011数据集上,该方法在‘无边界框’(without BB)和‘有边界框’(with BB)设置下的top-1准确率分别达到85.4%和85.5%,优于现有最先进方法。
  • 将四个基于部件的模型特征与属性特征结合后,准确率达到85.4%,证明了联合表征学习的有效性。
  • 与先前的弱监督方法相比,该模型能更准确地定位部件——例如,成功识别出尾部,而Liu et al. [5]等先前方法未能实现。
  • 利用属性描述作为监督信号可减少对昂贵部件位置标注的依赖,同时在性能上优于仅使用类别标签的监督方式。
  • 奖励策略可视化显示,经过200次训练迭代后,注意力策略已收敛至正确区域(如头部),证实了有效学习。
  • 通过R-CNN引入几何正则化的联合训练未能显著提升准确率(85.1% → 85.2%),表明该数据集中姿态可变性限制了几何建模的效果。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。