Skip to main content
QUICK REVIEW

[论文解读] Accurate RGB-D Salient Object Detection via Collaborative Learning

Wei Ji, Jingjing Li|arXiv (Cornell University)|Jul 23, 2020
Visual Attention and Saliency Detection参考文献 69被引用 14
一句话总结

本文提出 CoNet,一种用于高精度 RGB-D 显著性目标检测的协同学习框架,通过以相互受益的方式联合利用边缘、深度和显著性特征。该方法在推理阶段无需额外的深度网络或深度输入,即可将深度与显著性学习整合到高层特征学习中,从而在轻量化、高速(34 FPS)且边界保持清晰的前提下实现最先进性能。

ABSTRACT

Benefiting from the spatial cues embedded in depth images, recent progress on RGB-D saliency detection shows impressive ability on some challenge scenarios. However, there are still two limitations. One hand is that the pooling and upsampling operations in FCNs might cause blur object boundaries. On the other hand, using an additional depth-network to extract depth features might lead to high computation and storage cost. The reliance on depth inputs during testing also limits the practical applications of current RGB-D models. In this paper, we propose a novel collaborative learning framework where edge, depth and saliency are leveraged in a more efficient way, which solves those problems tactfully. The explicitly extracted edge information goes together with saliency to give more emphasis to the salient regions and object boundaries. Depth and saliency learning is innovatively integrated into the high-level feature learning process in a mutual-benefit manner. This strategy enables the network to be free of using extra depth networks and depth inputs to make inference. To this end, it makes our model more lightweight, faster and more versatile. Experiment results on seven benchmark datasets show its superior performance.

研究动机与目标

  • 解决现有 RGB-D 显著性模型的局限性,包括因 FCN 中池化/上采样导致的模糊目标边界,以及因独立深度网络带来的高计算成本。
  • 克服推理阶段对深度输入的依赖,从而限制 RGB-D 模型实际部署的问题。
  • 通过显式整合边缘信息并协同学习深度与显著性表征,提升边界精度与模型效率。
  • 开发一种统一、轻量化的框架,在测试时无需额外深度特征或输入即可保持高性能。

提出的方法

  • 提出一种协同学习框架(CoNet),包含三个相互受益的协作模块:边缘检测、粗粒度显著性检测与深度估计。
  • 使用专用的边缘协作模块,从低层特征中提取并增强边缘特征,从而提升显著性图中的边界定位精度。
  • 创新性地将深度与显著性学习整合到高层特征学习中,使网络在推理阶段无需使用深度图像即可推断与深度相关的语义信息。
  • 设计一个知识收集器(导师)模块,聚合并传递各协作模块的知识至主显著性头,以增强特征表示能力。
  • 采用端到端多任务学习进行模型训练,其中边缘、深度与显著性监督被联合优化。
  • 通过直接从 RGB 特征学习深度感知表征,消除对辅助深度网络的依赖,从而减小模型尺寸并缩短推理时间。

实验结果

研究问题

  • RQ1边缘监督是否能在不增加模型复杂度的前提下提升 RGB-D 显著性检测的边界精度?
  • RQ2能否在高层特征中联合优化深度与显著性学习,从而消除对独立深度网络的需求?
  • RQ3协同学习框架是否能在速度与轻量化方面超越现有 RGB-D 模型,同时实现最先进性能?
  • RQ4是否可能在推理阶段无需深度输入的情况下,仍保持显著性检测的高精度?
  • RQ5与 RGB 仅模型及 RGB-D 最先进模型相比,该方法在速度、精度与模型效率方面表现如何?

主要发现

  • CoNet 在七个基准数据集上均达到最先进性能,$F_{\beta}^{w}$ 分数分别为:NJUD 0.856、NLPR 0.850、DUT-RS 0.871,优于 22 种 SOTA 方法。
  • 模型实现 34 FPS 推理速度,较次佳 RGB-D 模型(DMRA)提升 55%,适用于实时应用。
  • 在全部七个数据集中,CoNet 的 MAE 值最低,DUT-RS 为 0.031,NLPR 也为 0.031,表明显著性预测具有高精度。
  • 模型效率显著更高,仅需 167.6 MB 模型大小,优于更大模型如 TANet(951.9 MB)与 MPCI(929.7 MB),在速度与精度上均表现更优。
  • 视觉结果表明,得益于边缘与深度感知特征学习,该模型在低对比度或含多个目标的复杂场景中展现出更优的边界保持与精度。
  • 定量比较证实,CoNet 的性能与顶尖 RGB 仅方法(如 CPD、PoolNet)相当,同时更有效地利用了深度信息。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。