[论文解读] RGB-D Salient Object Detection via 3D Convolutional Neural Networks
该论文提出RD3D,首个基于3D卷积神经网络的RGB-D显著目标检测模型,通过在编码器中使用膨胀3D卷积实现RGB与深度特征的早期预融合,并采用具有丰富反向投影路径(RBPP)和通道-模态注意力(CMA)的3D解码器实现深层融合。RD3D在六个基准数据集上超越14种最先进方法,通过渐进式、端到端的3D跨模态特征融合,展现出卓越的准确性。
RGB-D salient object detection (SOD) recently has attracted increasing research interest and many deep learning methods based on encoder-decoder architectures have emerged. However, most existing RGB-D SOD models conduct feature fusion either in the single encoder or the decoder stage, which hardly guarantees sufficient cross-modal fusion ability. In this paper, we make the first attempt in addressing RGB-D SOD through 3D convolutional neural networks. The proposed model, named RD3D, aims at pre-fusion in the encoder stage and in-depth fusion in the decoder stage to effectively promote the full integration of RGB and depth streams. Specifically, RD3D first conducts pre-fusion across RGB and depth modalities through an inflated 3D encoder, and later provides in-depth feature fusion by designing a 3D decoder equipped with rich back-projection paths (RBPP) for leveraging the extensive aggregation ability of 3D convolutions. With such a progressive fusion strategy involving both the encoder and decoder, effective and thorough interaction between the two modalities can be exploited and boost the detection accuracy. Extensive experiments on six widely used benchmark datasets demonstrate that RD3D performs favorably against 14 state-of-the-art RGB-D SOD approaches in terms of four key evaluation metrics. Our code will be made publicly available: https://github.com/PPOLYpubki/RD3D.
研究动机与目标
- 解决现有RGB-D SOD模型中跨模态融合能力有限的问题,这些模型仅在编码器或解码器中进行特征融合。
- 探索3D卷积神经网络在显著目标检测中实现RGB与深度模态有效、渐进式融合的潜力。
- 设计一个完全基于3D CNN的框架,实现编码器中的预融合与解码器中显式、深入的融合。
- 通过利用3D卷积的内在特征聚合能力,消除对复杂专用融合模块的需求。
- 验证丰富反向投影路径(RBPP)与通道-模态注意力(CMA)在增强多模态特征学习方面的有效性。
提出的方法
- 模型采用膨胀3D残差网络(ResNet)编码器,将深度图视为时间维度,对RGB与深度输入进行预融合,实现早期跨模态交互。
- 设计了一种新颖的3D解码器,包含丰富反向投影路径(RBPP),用于聚合编码器中的多层级特征,增强空间与模态感知的表征学习能力。
- 在解码器中集成通道-模态注意力(CMA)模块,根据通道与模态特定的重要性动态校准特征图。
- 采用渐进式融合策略:在3D编码器中进行预融合,在3D解码器中实现显式、模态感知的融合,确保全面的跨模态整合。
- 使用标准的显著性预测损失函数进行端到端训练,特征图在空间与时间(模态)维度上同步处理。
- 整个架构完全为3D设计,编码器与解码器中均应用3D卷积,与基于2D的先前方法形成鲜明对比。
实验结果
研究问题
- RQ13D卷积神经网络能否有效实现在编码器中对RGB与深度特征的预融合,从而提升显著目标检测性能?
- RQ2与标准2D或3D U-Net解码器相比,具有丰富反向投影路径(RBPP)的3D解码器是否能增强特征聚合与检测精度?
- RQ3所提出的通道-模态注意力(CMA)机制相比标准通道注意力,在3D上下文中如何提升模态感知的特征学习?
- RQ4完全基于3D CNN的框架是否优于现有基于2D的编码器-解码器模型,特别是在跨模态特征融合方面?
- RQ5编码器中的预融合与解码器中的融合对整体性能的相对贡献如何?
主要发现
- RD3D在六个广泛使用的RGB-D SOD基准数据集上达到最先进性能,在四个评估指标上全面超越14种现有SOTA方法。
- 消融实验表明,不附加任何模块的基线3D残差网络模型(Model-1)已超越近期两种SOTA模型(DANet与JL-DCF),证明了3D卷积固有的强大能力。
- 移除丰富反向投影路径(RBPP)导致性能持续下降,证实其在利用多层级、模态感知特征方面的有效性。
- 将所提出的CMA模块替换为标准的挤压-激励注意力机制会降低性能,确认了在3D上下文中通道-模态注意力机制的优越性。
- 完整RD3D模型(同时包含RBPP与CMA)取得最佳结果,消融实验表明两者结合可带来显著的性能增益。
- 该模型在推理速度与模型大小方面与双流网络相当,表明3D设计并未带来显著的计算开销。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。