Skip to main content
QUICK REVIEW

[论文解读] Contrast-Oriented Deep Neural Networks for Salient Object Detection

Guanbin Li, Yizhou Yu|arXiv (Cornell University)|Mar 30, 2018
Visual Attention and Saliency Detection参考文献 62被引用 3
一句话总结

本文提出了一种混合对比导向的深度神经网络用于显著性物体检测,结合了多尺度全卷积网络(MS-FCN)以实现密集的像素级显著性预测,以及基于区域的空域池化分支以建模区域对比。通过注意力融合模块自适应地结合两个分支的预测结果,同时采用定制的全连接CRF并引入显著轮廓特征,进一步提升空间一致性和边界准确性,在六个基准数据集上实现了最先进性能。

ABSTRACT

Deep convolutional neural networks have become a key element in the recent breakthrough of salient object detection. However, existing CNN-based methods are based on either patch-wise (region-wise) training and inference or fully convolutional networks. Methods in the former category are generally time-consuming due to severe storage and computational redundancies among overlapping patches. To overcome this deficiency, methods in the second category attempt to directly map a raw input image to a predicted dense saliency map in a single network forward pass. Though being very efficient, it is arduous for these methods to detect salient objects of different scales or salient regions with weak semantic information. In this paper, we develop hybrid contrast-oriented deep neural networks to overcome the aforementioned limitations. Each of our deep networks is composed of two complementary components, including a fully convolutional stream for dense prediction and a segment-level spatial pooling stream for sparse saliency inference. We further propose an attentional module that learns weight maps for fusing the two saliency predictions from these two streams. A tailored alternate scheme is designed to train these deep networks by fine-tuning pre-trained baseline models. Finally, a customized fully connected CRF model incorporating a salient contour feature embedding can be optionally applied as a post-processing step to improve spatial coherence and contour positioning in the fused result from these two streams. Extensive experiments on six benchmark datasets demonstrate that our proposed model can significantly outperform the state of the art in terms of all popular evaluation metrics.

研究动机与目标

  • 为克服基于块的CNN方法的局限性,后者由于对重叠区域的冗余处理而产生较高的计算和存储开销。
  • 解决全卷积网络(FCNs)的不足,后者因缺乏区域上下文信息和边界定位能力差,难以处理多尺度物体和语义信息弱的区域。
  • 通过互补的深度学习分支,显式地在像素和图像块两个层次建模视觉对比,以提升显著性检测性能。
  • 通过引入显著轮廓特征嵌入的定制全连接CRF,提升空间一致性和边界定位准确性。
  • 通过端到端可训练的框架,联合优化双流结构与后处理步骤,在多种基准数据集上实现最先进性能。

提出的方法

  • 使用多尺度全卷积网络(MS-FCN)通过利用多尺度感受野来捕获不同空间尺度下的视觉对比,实现密集显著性图的预测。
  • 基于多个图像分割层级的超像素,段级空域池化分支计算基于相邻区域间对比的稀疏显著性图。
  • 注意力融合模块学习动态权重,以结合MS-FCN与段级分支的预测结果,实现像素级与区域级对比信息的自适应融合。
  • 将定制的全连接CRF作为后处理步骤,引入显著轮廓特征嵌入,以优化空间一致性和边界定位性能。
  • 采用针对预训练基线模型的定制交替微调方案进行训练,实现双流结构的有效联合优化。
  • 在MS-FCN分支中采用多尺度输入(缩放因子1, 0.75, 0.5),以提升对不同尺寸物体的鲁棒性。

实验结果

研究问题

  • RQ1结合密集与稀疏预测分支的混合深度网络架构,是否能超越当前的全卷积网络或基于块的方法,在显著性物体检测中实现性能提升?
  • RQ2多尺度特征学习与段级对比建模是否能有效协同提升在多样尺度和语义信息弱的场景下对显著性物体的检测性能?
  • RQ3注意力融合机制在整合像素级与区域级显著性预测方面,其性能提升程度如何?
  • RQ4在CRF后处理步骤中引入显著轮廓特征,是否能显著提升边界准确性和空间一致性?
  • RQ5所提出的框架是否能在标准评估指标下,于多个基准数据集上持续实现最先进性能?

主要发现

  • 当在MS-FCN分支中使用ResNet-101替代VGG-16时,DUT-OMRON数据集上的最大F-measure提升3.62%,MAE降低7.32%。
  • 采用多尺度输入(缩放因子1, 0.75, 0.5)使DUT-OMRON数据集上的最大F-measure提升2.46%,MAE降低6.58%。
  • 采用多层级图像分割(三个分割层级)使DUT-OMRON数据集上的最大F-measure提升0.88%,MAE降低1.40%。
  • 与标准CRF相比,引入轮廓引导CRF后处理使基于VGG-16模型的最大F-measure提升1.50%,MAE降低8.57%。
  • 基于ResNet-101、多尺度输入与轮廓引导CRF的模型在DUT-OMRON数据集上达到最大F-measure 89.6%与MAE 0.048,优于先前最先进方法。
  • 在六个基准数据集上的大量实验表明,所提方法在所有标准评估指标(包括F-measure、MAE与E-measure)上均持续优于现有方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。