Skip to main content
QUICK REVIEW

[论文解读] Learning RGB-D Salient Object Detection using background enclosure, depth contrast, and top-down features

Riku Shigematsu, Dagan Feng|arXiv (Cornell University)|May 10, 2017
Visual Attention and Saliency Detection参考文献 26被引用 11
一句话总结

本文提出了一种新颖的深度卷积神经网络(CNN)架构,用于RGB-D显著目标检测,该架构整合了高层语义特征、低层深度对比特征以及一种新型的中层背景包围分布(BED)特征。该方法在RGBD1000数据集上实现了最先进性能,F-score达到0.848,较第二名方法高出10.7%,证明了结合深度对比与背景包围特征可有效提升显著性预测效果。

ABSTRACT

Recently, deep Convolutional Neural Networks (CNN) have demonstrated strong performance on RGB salient object detection. Although, depth information can help improve detection results, the exploration of CNNs for RGB-D salient object detection remains limited. Here we propose a novel deep CNN architecture for RGB-D salient object detection that exploits high-level, mid-level, and low level features. Further, we present novel depth features that capture the ideas of background enclosure and depth contrast that are suitable for a learned approach. We show improved results compared to state-of-the-art RGB-D salient object detection methods. We also show that the low-level and mid-level depth features both contribute to improvements in the results. Especially, F-Score of our method is 0.848 on RGBD1000 dataset, which is 10.7% better than the second place.

研究动机与目标

  • 开发一个完整的基于深度CNN的RGB-D显著目标检测系统,利用来自RGB和深度输入的多层次特征。
  • 通过引入新型深度特异性特征,弥补深度CNN在RGB-D显著性检测中研究不足的问题。
  • 通过融合低层深度对比与中层背景包围特征,提升检测精度。
  • 通过消融研究评估深度特征及所提出的BED特征的贡献。
  • 在RGBD1000和NJUDS2000等基准数据集上展示最先进性能。

提出的方法

  • 提出一种深度CNN架构,融合来自预训练网络(如VGG16)的高层特征、来自所提背景包围分布(BED)的中层特征,以及来自深度对比的低层特征。
  • 引入BED特征,一种中层深度表征,用于编码区域周围深度值的空间分布,以建模背景包围,适用于端到端学习。
  • 设计低层深度特征,显式编码深度对比——即区域深度与其周围深度值的差异——以增强局部显著性线索。
  • 采用多尺度融合策略,整合来自不同层次(低、中、高)的特征,生成优化的显著图。
  • 采用端到端训练流程,使用Adadelta优化器,结合数据增强(旋转与翻转),并在RGBD1000和NJUDS2000数据集上应用学习率衰减。
  • 通过将超像素直方图差异替换为平均深度,对噪声较大的深度数据(如NJUDS2000)进行特征表示适应,提升鲁棒性。

实验结果

研究问题

  • RQ1深度CNN架构能否有效整合RGB与深度特征,实现显著优于现有方法的显著目标检测?
  • RQ2与仅使用RGB的模型相比,低层深度对比特征在提升显著性检测性能方面有何贡献?
  • RQ3所提出的中层背景包围分布(BED)特征在多大程度上提升了检测性能?
  • RQ4高层、中层与低层特征的融合是否能带来更好的泛化能力与更高的基准数据集准确率?
  • RQ5在深度数据噪声较大的情况下,模型表现如何?特征自适应能否提升鲁棒性?

主要发现

  • 所提方法在RGBD1000数据集上取得0.848的F-score,较第二名方法高出10.7%,创下新的最先进结果。
  • 引入低层深度对比特征后,性能优于仅使用RGB的模型,F-score从ELD-Net的0.725提升至0.821。
  • BED特征对性能有显著贡献:移除该特征后,RGBD1000上的F-score从0.848降至0.841,表明其在建模背景包围方面具有有效性。
  • 在深度数据更嘈杂的NJUDS2000数据集上,将超像素直方图差异替换为平均深度(Ours*)后,F-score从0.817提升至0.833,表明对深度质量具有更强鲁棒性。
  • 模型在保持高召回率的同时提升了精确率,在精确率-召回率曲线中全面优于基于自底向上与自顶向下的RGB-D方法。
  • 消融研究证实,低层深度对比与中层BED特征均能独立提升检测性能,二者结合可获得最佳结果。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。