[论文解读] Adaptive Fusion for RGB-D Salient Object Detection
该论文提出了一种用于RGB-D显著目标检测的端到端自适应融合框架,采用双流卷积神经网络分别从RGB和深度模态生成独立的显著图,然后通过学习一个开关图实现基于模态可靠性的动态融合。该方法结合自适应融合与边缘保持损失,在三个基准数据集上均取得了最先进性能,显著提升了边界准确率和显著图的空间一致性。
RGB-D salient object detection aims to identify the most visually distinctive objects in a pair of color and depth images. Based upon an observation that most of the salient objects may stand out at least in one modality, this paper proposes an adaptive fusion scheme to fuse saliency predictions generated from two modalities. Specifically, we design a two-streamed convolutional neural network (CNN), each of which extracts features and predicts a saliency map from either RGB or depth modality. Then, a saliency fusion module learns a switch map that is used to adaptively fuse the predicted saliency maps. A loss function composed of saliency supervision, switch map supervision, and edge-preserving constraints is designed to make full supervision, and the entire network is trained in an end-to-end manner. Benefited from the adaptive fusion strategy and the edge-preserving constraint, our approach outperforms state-of-the-art methods on three publicly available datasets.
研究动机与目标
- 解决固定融合策略在RGB-D显著目标检测中无法充分利用颜色与深度模态互补信息的局限性。
- 克服当显著目标在某一模态中视觉模糊但在另一模态中清晰时的检测挑战。
- 通过新型边缘保持损失函数,提升显著图的边界准确率与空间一致性。
- 构建一个端到端可训练的框架,利用可学习的开关图自适应融合双模态预测结果。
- 在深度质量与场景复杂度各异的多样化数据集上实现一致的性能提升。
提出的方法
- 采用双流卷积神经网络架构,其中一路处理RGB图像,另一路处理深度图,分别独立提取特征并预测初始显著图。
- 设计显著图融合模块,通过学习开关图实现自适应融合,使每个空间位置对更可靠的模态预测赋予更高权重。
- 基于各模态预测的置信度构建伪真实开关图,用于监督开关图的学习过程。
- 引入边缘保持损失函数,惩罚显著边界处的偏差,从而增强空间一致性和减少模糊。
- 使用复合损失函数(包含显著图监督、开关图监督与边缘保持约束)端到端训练整个网络。
- 在每一流中采用多尺度特征聚合,以提升特征表示能力,同时保持模型简洁。
实验结果
研究问题
- RQ1自适应融合RGB与深度显著图预测是否优于固定融合策略(如逐元素相加或相乘)?
- RQ2当某一模态比另一模态更可靠时,学习模态特定的开关图是否能提升检测准确率?
- RQ3边缘保持损失在多大程度上提升了融合显著图的边界锐度与空间一致性?
- RQ4所提方法是否能在深度质量与场景复杂度各异的数据集上实现良好泛化?
- RQ5在显著目标仅在一个模态中可区分的场景下,自适应融合策略表现如何?
主要发现
- 所提方法在NJUD数据集上达到最大F-measure 0.899,在NLPR上为0.899,在STEREO上为0.904,全面超越所有当前最先进方法。
- 在NLPR数据集上,MAE降低至0.0327,显著优于次优方法PCA(0.0433),表明在高质量深度数据上表现卓越。
- 边缘保持损失有效减少了边界模糊,使显著图更加锐利且具有一致性,尤其在与背景外观相似的困难区域表现更优。
- 可视化对比显示,该方法在复杂场景中能更精准地定位显著目标,并在处理深度模糊性方面优于CTMF、MPCI和PCA。
- 开关图能有效抑制不可靠预测——例如在低对比度区域为RGB预测分配较低权重——体现了有效的模态选择能力。
- 该方法在所有指标与数据集上均持续优于PCA(强基线方法),证明了自适应融合与边缘正则化的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。