Skip to main content
QUICK REVIEW

[论文解读] Progressively Guided Alternate Refinement Network for RGB-D Salient Object Detection

Shuhan Chen, Yun Fu|arXiv (Cornell University)|Aug 17, 2020
Visual Attention and Saliency Detection参考文献 62被引用 7
一句话总结

该论文提出了一种轻量化、高效的RGB-D显著目标检测网络,通过从零开始训练的深度流提取互补的高层深度特征,避免了ImageNet预训练主干网络带来的不兼容性和冗余性。该方法采用交替细化策略与引导残差块,逐步优化预测结果,减少相互退化现象,提升准确率——在71 FPS的推理速度与64.9 MB模型大小下实现了最先进性能。

ABSTRACT

In this paper, we aim to develop an efficient and compact deep network for RGB-D salient object detection, where the depth image provides complementary information to boost performance in complex scenarios. Starting from a coarse initial prediction by a multi-scale residual block, we propose a progressively guided alternate refinement network to refine it. Instead of using ImageNet pre-trained backbone network, we first construct a lightweight depth stream by learning from scratch, which can extract complementary features more efficiently with less redundancy. Then, different from the existing fusion based methods, RGB and depth features are fed into proposed guided residual (GR) blocks alternately to reduce their mutual degradation. By assigning progressive guidance in the stacked GR blocks within each side-output, the false detection and missing parts can be well remedied. Extensive experiments on seven benchmark datasets demonstrate that our model outperforms existing state-of-the-art approaches by a large margin, and also shows superiority in efficiency (71 FPS) and model size (64.9 MB).

研究动机与目标

  • 解决在RGB-D显著目标检测中使用ImageNet预训练主干网络进行深度特征提取时存在的效率低下与不兼容问题。
  • 通过从零开始训练轻量化深度流,而非依赖预训练网络,减少模型冗余与计算成本。
  • 缓解RGB与深度特征之间的相互退化问题,尤其在深度图质量较低或存在噪声时。
  • 通过带有渐进引导的引导残差块,逐步优化粗略预测,提升检测准确率。
  • 在不牺牲性能的前提下实现高效率与紧凑性,支持实时推理。

提出的方法

  • 构建仅含四层卷积的轻量化深度流,从零开始训练,以提取高层深度特征,避免低层纹理冗余。
  • 使用多尺度残差(MSR)块,从RGB特征生成初始粗略预测。
  • 实施交替细化策略:按顺序将RGB与深度特征输入引导残差(GR)块,防止置信度高的RGB特征退化。
  • 设计引导残差(GR)块,使输入的预测图引导每个块中特征图与预测图的优化。
  • 在每个侧输出的堆叠GR块中引入渐进引导机制,使深层特征逐步优化浅层特征。
  • 在多尺度设置下使用侧输出,监督优化过程,提升定位精度。

实验结果

研究问题

  • RQ1从零开始训练的轻量化深度流是否能在减少模型大小与计算量的同时,优于预训练主干网络在RGB-D显著目标检测中的表现?
  • RQ2与早期或晚期融合相比,按顺序处理RGB与深度特征的交替细化策略是否能更有效地减少相互退化?
  • RQ3堆叠GR块中的渐进引导机制是否能有效修复显著目标预测中缺失部分与误检问题?
  • RQ4在低对比度图像、噪声深度图及复杂场景等挑战性场景下,所提方法表现如何?
  • RQ5该模型在保持最先进准确率的同时,能在多大程度上维持高推理速度与紧凑性?

主要发现

  • 所提模型在七项基准数据集上均达到最先进性能,持续优于现有方法,包括CPFP与DMRA。
  • 模型推理速度达71 FPS,模型大小仅为64.9 MB,显著优于其他SOTA模型的推理速度与效率。
  • 在NJUD与NLPR数据集上,即使CPFP与DMRA也避免使用预训练主干网络,本模型仍取得更高的F-measure与平均F-score。
  • 视觉对比显示,该模型在低对比度图像、噪声深度图以及包含多个小目标的复杂场景中,仍能成功检测显著目标。
  • PR曲线显示优越性能,尤其在高召回率水平下,表明能更完整地检测显著目标。
  • 消融实验验证,交替细化策略与渐进引导机制显著提升了检测准确率,并增强了对低质量深度输入的鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。