Skip to main content
QUICK REVIEW

[论文解读] Learning Selective Mutual Attention and Contrast for RGB-D Saliency Detection

Nian Liu, Ni Zhang|arXiv (Cornell University)|Oct 12, 2020
Visual Attention and Saliency Detection参考文献 47被引用 5
一句话总结

本文提出了一种用于RGB-D显著性目标检测的新颖互注意力机制,通过利用跨模态非局部注意力,实现RGB与深度特征之间的高阶、三线性特征交互。通过使用一种模态的注意力来引导另一种模态中的上下文传播,并结合对比学习与选择性深度重加权,SMAC模型在多个基准测试中实现了最先进性能,尤其在真实场景中表现显著提升,其有效性通过一个新的大规模、高质量RGB-D数据集ReDWeb-S得到验证。

ABSTRACT

How to effectively fuse cross-modal information is the key problem for RGB-D salient object detection. Early fusion and the result fusion schemes fuse RGB and depth information at the input and output stages, respectively, hence incur the problem of distribution gap or information loss. Many models use the feature fusion strategy but are limited by the low-order point-to-point fusion methods. In this paper, we propose a novel mutual attention model by fusing attention and contexts from different modalities. We use the non-local attention of one modality to propagate long-range contextual dependencies for the other modality, thus leveraging complementary attention cues to perform high-order and trilinear cross-modal interaction. We also propose to induce contrast inference from the mutual attention and obtain a unified model. Considering low-quality depth data may detriment the model performance, we further propose selective attention to reweight the added depth cues. We embed the proposed modules in a two-stream CNN for RGB-D SOD. Experimental results have demonstrated the effectiveness of our proposed model. Moreover, we also construct a new challenging large-scale RGB-D SOD dataset with high-quality, thus can both promote the training and evaluation of deep models.

研究动机与目标

  • 为解决早期、结果导向及简单特征融合在RGB-D显著性检测中的局限性,这些方法易受分布差异或跨模态交互不足的影响。
  • 开发一种高阶、三线性跨模态交互机制,利用RGB与深度模态之间的互补注意力线索。
  • 通过选择性注意力机制重新加权深度特征,减轻低质量深度数据的负面影响。
  • 构建一个新的大规模、高质量RGB-D基准数据集(ReDWeb-S),以更好地训练和评估真实世界显著性检测模型。
  • 将互注意力与对比学习统一为单一端到端可训练框架,以提升整体性能。

提出的方法

  • 提出一种互注意力机制,其中一种模态(如深度)的非局部注意力用于引导另一种模态(如RGB)中的长程上下文传播,从而实现高阶跨模态交互。
  • 引入对比学习模块,通过对比互注意力图生成的正样本与负样本,增强特征的判别能力。
  • 设计选择性注意力机制,根据可靠性对深度特征进行重加权,降低低质量深度图中的噪声影响。
  • 将所提出的SMAC模块嵌入双流U-Net架构中,实现RGB-D显著性检测的端到端训练与推理。
  • 使用非局部网络计算空间位置之间的查询-键相似度,以捕捉并传播长程上下文依赖关系。
  • 采用三线性池化方法建模RGB与深度特征之间的高阶交互,捕捉复杂的跨模态关系。

实验结果

研究问题

  • RQ1结合非局部上下文传播的跨模态互注意力是否能显著提升RGB-D显著性检测性能,超越标准特征融合方法?
  • RQ2从互注意力中引入对比学习如何增强RGB-D显著性模型的特征判别能力?
  • RQ3对深度特征的选择性重加权在多大程度上可缓解低质量深度数据带来的性能下降?
  • RQ4一个全新的大规模真实世界RGB-D数据集,配备高质量深度图,是否能提升SOTA模型的泛化能力与性能表现?
  • RQ5一个统一模型,整合互注意力、对比学习与选择性深度加权,是否能在多种基准上超越现有SOTA方法?

主要发现

  • 所提出的SMAC模型在九个基准数据集中的八个上超越了先前最先进方法,尤其在复杂真实场景中表现显著提升。
  • SMAC*变体在新数据集ReDWeb-S上进行训练后,在大多数数据集上性能优于SMAC,尤其在包含真实世界场景的SIP数据集中表现更优。
  • 在RGBD135和DUTLF-Depth等聚焦近距离、简单人工物体的数据集中,SMAC性能优于SMAC*,表明ReDWeb-S通过增加真实世界多样性,有效补充了现有数据集。
  • 在NJUD + ReDWeb-S联合训练设置下,平均性能排名(APR)达到2.72,为所有单数据集与双数据集训练设置中的最佳结果,证明了ReDWeb-S的互补价值。
  • 定性结果表明,SMAC与SMAC*在复杂场景、小目标、多目标、远距离目标及不显眼目标的显著性目标检测中表现优异,而这些正是以往方法难以应对的挑战。
  • 消融实验验证了每个组件——互注意力、对比学习与选择性注意力——均对最终性能提升有贡献,其中互注意力的影响最为显著。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。