Skip to main content
QUICK REVIEW

[论文解读] Semantic Aware Attention Based Deep Object Co-segmentation

Hong Chen, Yifei Huang|arXiv (Cornell University)|Oct 16, 2018
Visual Attention and Saliency Detection被引用 6
一句话总结

该论文提出了一种新型基于注意力机制的深度学习模型,用于语义感知的物体共同分割。该模型在瓶颈层引入可学习的注意力机制,以选择性地增强跨多张图像的语义相关特征通道。通过用全局注意力替代成对相关性,该方法实现了线性时间复杂度的最先进性能,从而实现了高效的多图像共同分割,并能泛化到未见过的物体。

ABSTRACT

Object co-segmentation is the task of segmenting the same objects from multiple images. In this paper, we propose the Attention Based Object Co-Segmentation for object co-segmentation that utilize a novel attention mechanism in the bottleneck layer of deep neural network for the selection of semantically related features. Furthermore, we take the benefit of attention learner and propose an algorithm to segment multi-input images in linear time complexity. Experiment results demonstrate that our model achieves state of the art performance on multiple datasets, with a significant reduction of computational time.

研究动机与目标

  • 解决现有共同分割方法随输入图像数量增加而呈二次方增长的局限性。
  • 实现在不依赖成对特征相关性的前提下,对多张图像进行高效且可扩展的共同分割。
  • 通过选择性增强跨输入的语义相关特征通道,提高分割精度。
  • 利用预训练特征和注意力机制,实现对训练数据中未出现过的物体类别的泛化能力。

提出的方法

  • 模型使用基于VGG16的编码器从多张输入图像中提取深层特征。
  • 在瓶颈层引入语义注意力学习器,以动态强调在不同输入中由相同语义类别激活的特征通道。
  • 提出三种注意力机制——全局平均、全局最小值和分组平均——以基于图像间语义一致性来引导特征选择。
  • 注意力机制通过全连接层和平均池化层实现,从而实现线性时间推理,而非二次方时间的成对相关性计算。
  • 解码头从注意力处理后的特征中重建最终的分割掩码。
  • 在全局平均池化后添加空间注意力,以恢复因全局池化而丢失的空间细节。

实验结果

研究问题

  • RQ1在瓶颈层引入可学习的注意力机制,能否有效识别并增强跨多张图像的语义一致特征以实现共同分割?
  • RQ2用全局注意力替代成对相关性,是否能在不损失精度的前提下实现线性时间的共同分割?
  • RQ3该模型能否泛化到训练过程中未见过的物体类别?
  • RQ4注意力机制如何提升对外观和背景变化的鲁棒性?

主要发现

  • 所提模型在MSRC、Internet和iCoseg数据集上均达到最先进性能,在iCoseg数据集未见物体上的F1得分为87.1。
  • 通过避免成对相关性,将计算复杂度从二次方降低为线性时间,实现了多张图像高效群体共同分割。
  • 在iCoseg数据集上,即时群体共同分割方法在未见物体上的表现优于成对方法(CA)(F1得分87.1 vs. 84.2)。
  • 可视化结果表明,通道级注意力具有类别特异性且解耦,不同物体类别表现出不同的注意力模式。
  • 空间注意力图成功恢复了在全局平均池化后丢失的局部语义细节。
  • 该模型对背景和外观变化表现出鲁棒性,能有效在多样化图像中共同分割物体。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。