[论文解读] RGB-D Salient Object Detection with Cross-Modality Modulation and Selection
本文提出了一种新颖的RGB-D显著性目标检测网络,通过交叉模态特征调制(cmFM)和自适应特征选择(AFS)增强特征表示,实现精确且边缘保持的显著性预测。该方法通过统一的cmMS模块整合调制、选择与注意力机制,在粗到细的渐进特征优化过程中,在六个基准数据集上实现了最先进性能。
We present an effective method to progressively integrate and refine the cross-modality complementarities for RGB-D salient object detection (SOD). The proposed network mainly solves two challenging issues: 1) how to effectively integrate the complementary information from RGB image and its corresponding depth map, and 2) how to adaptively select more saliency-related features. First, we propose a cross-modality feature modulation (cmFM) module to enhance feature representations by taking the depth features as prior, which models the complementary relations of RGB-D data. Second, we propose an adaptive feature selection (AFS) module to select saliency-related features and suppress the inferior ones. The AFS module exploits multi-modality spatial feature fusion with the self-modality and cross-modality interdependencies of channel features are considered. Third, we employ a saliency-guided position-edge attention (sg-PEA) module to encourage our network to focus more on saliency-related regions. The above modules as a whole, called cmMS block, facilitates the refinement of saliency features in a coarse-to-fine fashion. Coupled with a bottom-up inference, the refined saliency features enable accurate and edge-preserving SOD. Extensive experiments demonstrate that our network outperforms state-of-the-art saliency detectors on six popular RGB-D SOD benchmarks.
研究动机与目标
- 为解决在显著性目标检测中有效整合互补的RGB与深度特征的挑战。
- 通过更稳健地建模跨模态关系,减少不一致或噪声深度图带来的干扰。
- 在多模态上下文中,自适应地选择空间与通道维度上与显著性相关联的特征。
- 通过位置与边缘感知注意力机制,提升显著性图的边界准确度与完整性。
- 通过统一的粗到细优化流程,在多个RGB-D SOD基准数据集上实现最先进性能。
提出的方法
- 引入交叉模态特征调制(cmFM)模块,利用深度特征作为先验,通过可学习调制机制增强RGB特征表示,避免简单的拼接或相加操作。
- 提出自适应特征选择(AFS)模块,对多模态空间特征实施门控融合,同时建模自模态与跨模态通道注意力,实现动态特征加权。
- 采用显著性引导的位置-边缘注意力(sg-PEA)模块,利用预测的显著性图与边缘图引导注意力机制,突出显著区域与边缘。
- 将cmFM、AFS与sg-PEA整合为统一的cmMS模块,通过调制、选择与注意力的顺序处理,实现显著性特征的粗到细优化。
- 采用自底向上的特征推理进一步提升最终显著性图的检测精度与边缘保持能力。
- 整个网络采用标准监督方式端到端训练,利用多尺度监督提升定位性能。
实验结果
研究问题
- RQ1如何有效整合RGB与深度特征,以超越简单的早期或晚期融合方式,提升显著性检测性能?
- RQ2在噪声或不一致的深度输入下,跨空间与通道维度自适应选择显著性相关特征是否能提升模型性能?
- RQ3通过预测显著性图引导的位置与边缘注意力机制,在多大程度上能提升边界准确度?
- RQ4结合调制、选择与优化的粗到细模块化流程,是否优于现有RGB-D SOD架构?
- RQ5所提出的框架是否具备跨多样化基准数据集的泛化能力,并实现最先进性能?
主要发现
- 所提出的cmMS模块(集成cmFM、AFS与sg-PEA)在六个主流RGB-D SOD基准数据集上均达到最先进性能。
- 消融实验表明,移除cmFM模块会导致性能显著下降:在STEREO数据集上,$F_\beta$ 从 0.9084 降至 0.8727。
- AFS模块显著提升性能:移除该模块后,STEREO数据集上的$F_\beta$降至 0.8990,而以传统通道注意力替代则仅带来微小增益。
- sg-PEA模块对边界准确度至关重要:移除该模块后,STEREO数据集上的$F_\beta$降至 0.9057,若移除边缘注意力组件则导致边界模糊。
- 完整模型在DUT-Test数据集上达到$F_\beta$为 0.9328 与 MAE 为 0.0366,优于先前最先进方法。
- 可视化对比结果表明,所提方法生成的显著性图比CPFP与A2dele更完整、更清晰且边缘保持更佳。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。