Skip to main content
QUICK REVIEW

[论文解读] Weakly Supervised Bilinear Attention Network for Fine-Grained Visual Classification

Tao Hu, Jizheng Xu|arXiv (Cornell University)|Aug 6, 2018
Advanced Neural Network Applications参考文献 27被引用 9
一句话总结

该论文提出了一种弱监督双线性注意力网络(WS-BAN),这是一种新颖的端到端框架,用于细粒度视觉分类。该框架通过可学习的注意力图联合定位多个物体部件,并利用双线性注意力池化(BAP)提取判别性特征。通过引入注意力正则化和dropout进行弱监督训练,WS-BAN在CUB-200-2011、Stanford Cars和FGVC-Aircraft数据集上均取得了最先进(SOTA)的准确率,分别为92.3%、93.6%和88.8%的top-1准确率。

ABSTRACT

For fine-grained visual classification, objects usually share similar geometric structure but present variant local appearance and different pose. Therefore, localizing and extracting discriminative local features play a crucial role in accurate category prediction. Existing works either pay attention to limited object parts or train isolated networks for locating and classification. In this paper, we propose Weakly Supervised Bilinear Attention Network (WS-BAN) to solve these issues. It jointly generates a set of attention maps (region-of-interest maps) to indicate the locations of object's parts and extracts sequential part features by Bilinear Attention Pooling (BAP). Besides, we propose attention regularization and attention dropout to weakly supervise the generating process of attention maps. WS-BAN can be trained end-to-end and achieves the state-of-the-art performance on multiple fine-grained classification datasets, including CUB-200-2011, Stanford Car and FGVC-Aircraft, which demonstrated its effectiveness.

研究动机与目标

  • 解决细粒度视觉分类中的挑战,即类内差异大且类间差异细微,导致准确识别困难。
  • 克服现有弱监督方法仅关注少数物体部件而忽略判别性较低区域的局限性。
  • 通过端到端地联合学习注意力图与部件特征,提升部件定位与特征表示能力。
  • 通过仅使用图像级别标签进行弱监督训练,减少对昂贵部件级标注的依赖。
  • 通过正则化和dropout鼓励关注多个部件,提升模型对遮挡和视角变化的鲁棒性。

提出的方法

  • 提出双线性注意力池化(BAP),通过特征图与可学习注意力图的逐元素相乘生成部件特征矩阵,随后经过卷积和全局池化操作。
  • 引入注意力正则化,将同一类别部件的特征拉向共享中心,以鼓励一致的部件表示。
  • 在训练过程中应用注意力dropout,随机禁用注意力图,迫使网络关注判别性较低的区域,从而提升泛化能力。
  • 通过通道维度平均并应用阈值处理,将最终的注意力图用作物体部件定位掩码,生成边界框。
  • 仅使用图像级别类别标签端到端训练整个网络,实现无需部件标注的弱监督学习。
  • 采用深层CNN主干网络(如ResNet)提取初始特征图,随后由BAP模块和注意力头进行处理。

实验结果

研究问题

  • RQ1弱监督方法是否能在无需部件级标注的情况下,有效定位多个细粒度物体部件?
  • RQ2与仅关注少数部件的方法相比,联合学习注意力图与部件特征在提升分类准确率方面有何优势?
  • RQ3注意力正则化和dropout在多大程度上提升了部件定位的多样性与鲁棒性?
  • RQ4模型生成的注意力图能否有效用于物体定位与边界框预测?
  • RQ5注意力图数量的增加在准确率与定位质量方面对模型性能有何影响?

主要发现

  • WS-BAN在FGVC-Aircraft数据集上达到92.3%的最先进(SOTA)top-1准确率,超越了此前方法如MPN-COV(93.3%)和MAMC(93.0%)。
  • 在CUB-200-2011数据集上,WS-BAN达到92.3%的准确率,优于RA-CNN(88.4%)和MA-CNN(89.9%),表明其在鸟类物种分类任务中表现更优。
  • 在Stanford Cars数据集上,WS-BAN实现93.6%的准确率,超过此前SOTA方法MPN-COV(93.3%)和MAMC(93.0%)。
  • 在CUB-200-2011数据集上,物体定位误差降低至28.2%,显著低于GoogLeNet-GAP(59.0%)和VGGnet-ACoL(54.1%),表明其定位能力更强。
  • 将注意力图数量从4增加到128,可使分类准确率从85.9%提升至88.8%,mIOU从53.4%提升至58.2%,表明更多部件有助于性能提升。
  • 可视化结果表明,引入注意力正则化和dropout后,注意力图在物体部件(如头部、翅膀、身体)上分布更均匀,而基线BAP方法仅产生稀疏且不一致的注意力图。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。