Skip to main content
QUICK REVIEW

[论文解读] Deep Reasoning with Multi-Scale Context for Salient Object Detection

Zun Li, Congyan Lang|arXiv (Cornell University)|Jan 24, 2019
Visual Attention and Saliency Detection参考文献 50被引用 12
一句话总结

本文提出了一种基于多空洞深度可分离卷积的深度且轻量化的显著性推理模块,以增强显著性物体检测。通过聚焦于提升此前被忽视的推理头推理能力,而非复杂的主干网络,该方法在计算成本更低的情况下实现了最先进性能,在多个基准测试中优于现有模型。

ABSTRACT

To detect salient objects accurately, existing methods usually design complex backbone network architectures to learn and fuse powerful features. However, the saliency inference module that performs saliency prediction from the fused features receives much less attention on its architecture design and typically adopts only a few fully convolutional layers. In this paper, we find the limited capacity of the saliency inference module indeed makes a fundamental performance bottleneck, and enhancing its capacity is critical for obtaining better saliency prediction. Correspondingly, we propose a deep yet light-weight saliency inference module that adopts a multi-dilated depth-wise convolution architecture. Such a deep inference module, though with simple architecture, can directly perform reasoning about salient objects from the multi-scale convolutional features fast, and give superior salient object detection performance with less computational cost. To our best knowledge, we are the first to reveal the importance of the inference module for salient object detection, and present a novel architecture design with attractive efficiency and accuracy. Extensive experimental evaluations demonstrate that our simple framework performs favorably compared with the state-of-the-art methods with complex backbone design.

研究动机与目标

  • 识别并解决显著性物体检测中被低估的瓶颈:显著性推理模块的容量有限。
  • 通过增强推理头的推理能力,在不增加模型复杂度的前提下提升显著性检测性能。
  • 设计一种计算高效的架构,利用多尺度特征实现更优的推理与预测。
  • 证明精心设计的推理模块可超越具有复杂主干网络和特征融合的模型。

提出的方法

  • 引入基于堆叠多空洞深度可分离卷积层的深度显著性推理模块,以捕捉长距离上下文依赖关系。
  • 采用深度可分离卷积和逐点分组卷积,在保持低参数量和计算成本的同时实现深度推理。
  • 使用自顶向下的特征融合路径与侧向连接,将主干网络(如VGG、ResNet)的多尺度特征进行融合。
  • 在最后应用1×1卷积,从优化后的特征生成最终的显著性图。
  • 设计模块以直接对融合的多尺度特征进行推理,避免了先前工作中常见的浅层推理头。
  • 通过将推理模块与特征提取解耦,确保其可与任何标准主干网络兼容。

实验结果

研究问题

  • RQ1显著性推理模块是否构成现有显著性检测框架中的根本性能瓶颈?
  • RQ2更深、更具能力的推理模块是否能在不增加计算成本的情况下提升检测精度?
  • RQ3深度可分离卷积中的多空洞机制如何增强对多尺度特征的推理能力?
  • RQ4增加推理模块的深度对检测性能和效率有何影响?
  • RQ5简单的轻量化架构是否能超越具有更深主干网络和广泛监督的复杂模型?

主要发现

  • 在VGG主干下,SRNet-R模型在DUT-OMRON数据集上的Fβ-max得分比HFS高出2.6%,比BPS高出5.6%。
  • 在具有挑战性的SOD和DUT-OMRON数据集中,SRNet-R相比SRNet-V显著提升,证明了多空洞机制的有效性。
  • 将推理模块深度从1层增至24层(SRNet-R)后,DUTS-Test数据集上的F-measure最高提升1.5%,表明更深推理带来性能增益。
  • 尽管网络更深,但由于采用深度可分离卷积和分组卷积,模型的推理速度仍与基线模型相当——每张480×320图像约0.27秒。
  • 视觉结果表明,完整的SRNet模型生成的显著性图更完整、更准确,尤其在物体靠近图像边界或与背景对比度较低时表现更优。
  • 消融实验表明,推理模块本身对性能贡献显著:BFR(无空洞)优于HFS和BPS,而SRNet(带空洞)进一步提升了性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。