Skip to main content
QUICK REVIEW

[论文解读] Decoupled Spatial Neural Attention for Weakly Supervised Semantic Segmentation

Tianyi Zhang, Guosheng Lin|arXiv (Cornell University)|Mar 7, 2018
Multimodal Machine Learning Applications参考文献 39被引用 10
一句话总结

该论文提出了一种解耦的空间神经注意力机制,能够在一次前向传播中同时识别物体区域和判别性部件,仅使用图像级别标签即可生成弱监督语义分割的高质量伪标注。该方法在PASCAL VOC 2012基准上实现了最先进性能,在测试集上达到56.4%的mIoU,优于相同监督设置下的先前方法,且无需迭代训练或外部数据。

ABSTRACT

Weakly supervised semantic segmentation receives much research attention since it alleviates the need to obtain a large amount of dense pixel-wise ground-truth annotations for the training images. Compared with other forms of weak supervision, image labels are quite efficient to obtain. In our work, we focus on the weakly supervised semantic segmentation with image label annotations. Recent progress for this task has been largely dependent on the quality of generated pseudo-annotations. In this work, inspired by spatial neural-attention for image captioning, we propose a decoupled spatial neural attention network for generating pseudo-annotations. Our decoupled attention structure could simultaneously identify the object regions and localize the discriminative parts which generates high-quality pseudo-annotations in one forward path. The generated pseudo-annotations lead to the segmentation results which achieve the state-of-the-art in weakly-supervised semantic segmentation.

研究动机与目标

  • 为仅使用图像级别标签生成高质量伪标注以解决弱监督语义分割的挑战。
  • 克服现有自顶向下显著性方法仅关注判别性部件而忽略完整物体范围的局限性。
  • 开发一种简单、端到端、非迭代的流水线,避免启发式多步训练或对外部数据的依赖。
  • 通过解耦注意力机制联合建模物体区域与判别性部件,提升分割性能。

提出的方法

  • 提出一种解耦的空间神经注意力模块,可在一次前向传播中生成两个独立的类别特定注意力图。
  • 扩展注意力图聚焦于识别物体区域的完整范围,而判别性注意力图则突出关键判别性部件。
  • 两种注意力图具有互补性,共同用于生成更精确的伪标注以训练分割网络。
  • 该方法集成于两阶段流水线中:首先,解耦注意力网络从图像级别标签生成伪标注;其次,使用这些伪标注训练一个类似DeepLab的分割网络。
  • 整个流水线以端到端方式在单次训练中完成,无需迭代优化或外部监督。
  • 在分割头中使用ResNet-101和VGG-16作为主干网络,解耦注意力模块置于最终分类层之前。

实验结果

研究问题

  • RQ1单一的、端到端的注意力机制能否有效同时定位完整的物体区域和判别性部件?
  • RQ2将空间注意力解耦为两个互补的注意力图,是否相比标准自顶向下显著性方法能提升伪标注质量?
  • RQ3非迭代、单次通过的训练流水线能否在弱监督语义分割中实现最先进性能?
  • RQ4与使用外部数据或迭代优化的现有方法相比,所提方法表现如何?

主要发现

  • 所提方法在PASCAL VOC 2012测试集上实现了56.4%的平均交并比(mIoU),在相同监督设置下刷新了弱监督语义分割的最先进水平。
  • 采用ResNet-101主干网络时,该方法在测试集上达到60.1%的mIoU,超越了所有仅使用图像级别标签且无外部数据的现有方法。
  • 消融实验表明,扩展注意力图与判别性注意力图均对性能有显著贡献,解耦设计优于单注意力基线模型。
  • 该方法在无需迭代训练或外部数据的情况下取得优越结果,表明其相比先前方法具有更简单、更高效的流水线。
  • 图7的定性结果表明,生成的伪标注与真实掩码高度一致,尤其在捕捉完整物体形状和关键部件方面表现优异。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。