Skip to main content
QUICK REVIEW

[论文解读] Deep RGB-D Saliency Detection with Depth-Sensitive Attention and Automatic Multi-Modal Fusion

Peng Sun, Zhang Wenhu|arXiv (Cornell University)|Mar 22, 2021
Visual Attention and Saliency Detection参考文献 39被引用 8
一句话总结

本文提出 DSA2F,一种新颖的双流框架,用于 RGB-D 显著性目标检测,通过深度感知注意力增强 RGB 特征,以减少背景杂波,并通过任务特定的神经架构搜索(NAS)自动发现最优的多模态融合架构。该方法通过利用深度几何先验和针对多尺度异质特征融合的定制化搜索空间,在七个基准测试中实现了最先进性能。

ABSTRACT

RGB-D salient object detection (SOD) is usually formulated as a problem of classification or regression over two modalities, i.e., RGB and depth. Hence, effective RGBD feature modeling and multi-modal feature fusion both play a vital role in RGB-D SOD. In this paper, we propose a depth-sensitive RGB feature modeling scheme using the depth-wise geometric prior of salient objects. In principle, the feature modeling scheme is carried out in a depth-sensitive attention module, which leads to the RGB feature enhancement as well as the background distraction reduction by capturing the depth geometry prior. Moreover, to perform effective multi-modal feature fusion, we further present an automatic architecture search approach for RGB-D SOD, which does well in finding out a feasible architecture from our specially designed multi-modal multi-scale search space. Extensive experiments on seven standard benchmarks demonstrate the effectiveness of the proposed approach against the state-of-the-art.

研究动机与目标

  • 为解决在 RGB-D 显著性目标检测中有效利用深度几何先验以改善特征表示并减少背景干扰的挑战。
  • 设计一种面向 RGB-D 显著性检测中多模态、多尺度特征融合的任务特定神经架构搜索(NAS)空间。
  • 自动发现 RGB 与深度分支之间超越手工设计的非对称最优融合架构,以提升性能。
  • 通过在七个标准 RGB-D 基准上的大量实验,证明所提方法的有效性。

提出的方法

  • 深度感知注意力模块(DSAM)将原始深度图分解为多个深度区间区域,并基于深度几何信息对空间注意力进行应用,以增强 RGB 特征,减少背景干扰。
  • 该方法引入一种新型的多模态、多尺度 NAS 搜索空间,整合空间与通道注意力操作,以有效建模异质的 RGB 与深度特征。
  • 采用可微架构搜索(基于 DARTS)从设计的搜索空间中自动发现最优融合架构,骨干网络采用 VGG-19。
  • 该框架在 DSAM 中使用逐元素乘法作为融合操作,其作为空间注意力机制,根据基于深度的几何线索对 RGB 特征进行加权。
  • 搜索空间包含四种单元类型(MM、MS、GA、SR),并支持跳跃连接与注意力机制,以实现灵活且高容量的架构发现。
  • 最终架构采用多尺度监督进行端到端训练,融合模块与骨干网络联合优化。

实验结果

研究问题

  • RQ1能否有效利用基于深度的几何先验来增强 RGB 特征并抑制显著性目标检测中的背景干扰?
  • RQ2能否设计一种面向任务的神经架构搜索空间,以自动发现 RGB-D 显著性检测中多模态、多尺度融合架构的最优解?
  • RQ3所提出的基于 NAS 的融合架构是否优于 RGB-D 显著性检测中手工设计的人为融合模块?
  • RQ4分解过程中深度区域的数量如何影响深度感知注意力模块的性能?

主要发现

  • 所提出的深度感知注意力模块(DSAM)在 DUT-RGBD 上将基线 Fβ 分数提升了 5.9 个百分点,平均误差(M)从 0.069 降低至 0.051。
  • 完整 DSA2F 框架实现了最先进性能,在 DUT-RGBD 上 Fβ 得分为 0.926,平均误差为 0.030,相比基线在 Fβ 上提升了 9.6%。
  • 最优深度分解使用三个区域(T+1=3),在捕捉深度区间与避免过拟合之间实现了最佳平衡。
  • 在 NAS 搜索空间中引入注意力操作使 DUT-RGBD 上的 Fβ 提升 1.2%,证明其在特征精炼中的关键作用。
  • 自动搜索的融合架构在 NLPR 上实现 Fβ 0.897 和 M 0.024,相比基线在 Fβ 上提升 13.5%。
  • 消融实验表明,DSAM、基于 NAS 的融合模块以及完整架构的各组件在全部七个基准测试中均对性能提升有显著贡献。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。