[论文解读] Self-Supervised Pretraining for RGB-D Salient Object Detection
本论文提出了一种用于RGB-D显著性物体检测的自监督预训练框架,采用两种掩蔽任务——跨模态自编码与深度轮廓估计,从而实现从无标注RGB-D数据中有效学习特征。该方法在六个基准数据集上达到最先进性能,以极低的标注成本超越ImageNet预训练模型,并引入一种通用的一致性-差异聚合模块,以提升跨模态与跨层级特征融合效果。
Existing CNNs-Based RGB-D salient object detection (SOD) networks are all required to be pretrained on the ImageNet to learn the hierarchy features which helps provide a good initialization. However, the collection and annotation of large-scale datasets are time-consuming and expensive. In this paper, we utilize self-supervised representation learning (SSL) to design two pretext tasks: the cross-modal auto-encoder and the depth-contour estimation. Our pretext tasks require only a few and unlabeled RGB-D datasets to perform pretraining, which makes the network capture rich semantic contexts and reduce the gap between two modalities, thereby providing an effective initialization for the downstream task. In addition, for the inherent problem of cross-modal fusion in RGB-D SOD, we propose a consistency-difference aggregation (CDA) module that splits a single feature fusion into multi-path fusion to achieve an adequate perception of consistent and differential information. The CDA module is general and suitable for cross-modal and cross-level feature fusion. Extensive experiments on six benchmark datasets show that our self-supervised pretrained model performs favorably against most state-of-the-art methods pretrained on ImageNet. The source code will be publicly available at extcolor{red}{\url{https://github.com/Xiaoqi-Zhao-DLUT/SSLSOD}}.
研究动机与目标
- 为解决ImageNet风格预训练的高昂成本,提出仅使用无标注RGB-D数据进行自监督预训练,以实现RGB-D显著性物体检测。
- 通过设计促使网络学习跨模态表示的掩蔽任务,减少RGB与深度特征之间的模态差异。
- 通过一种通用的一致性-差异聚合(CDA)模块,提升RGB-D显著性物体检测中跨模态与跨层级的特征融合效果。
- 建立一个不依赖ImageNet预训练的新基线,实现更高效且可扩展的模型初始化。
提出的方法
- 设计一种跨模态自编码掩蔽任务,通过从深度图重建RGB图像,反之亦然,以促进语义与结构表示的联合学习。
- 引入一种深度轮廓估计掩蔽任务,促使网络从深度数据中学习清晰的物体边界与空间关系。
- 在大规模弱标注RGB-D数据集上,联合使用这两个掩蔽任务对编码器进行训练,无需人工标注类别标签。
- 提出一种一致性-差异聚合(CDA)模块,将特征融合过程拆分为一致路径与差异路径,以增强互补信息的整合。
- 将自监督预训练的编码器作为下游RGB-D显著性物体检测网络的强初始化,替代ImageNet预训练。
- 在六个基准数据集上使用标准指标评估方法,并与ImageNet预训练的最先进模型进行比较。
实验结果
研究问题
- RQ1自监督掩蔽任务是否能在无任何人工标注数据的情况下,有效替代ImageNet预训练用于RGB-D显著性物体检测?
- RQ2跨模态自编码与深度轮廓估计在RGB-D显著性物体检测中如何共同促进鲁棒且模态对齐的特征学习?
- RQ3自监督预训练方案在多大程度上能够缩小RGB与深度特征之间的模态差距?
- RQ4一致性-差异聚合(CDA)模块在增强跨模态与跨层级特征融合方面有多有效?
- RQ5所提出的自监督预训练方法是否能在不同主干网络架构与下游SOD模型上实现泛化?
主要发现
- 与随机初始化相比,所提出的自监督预训练方案在基准数据集上实现了加权F-measure 7.95%的相对提升,以及平均绝对误差(MAE)27.42%的降低。
- 仅使用约6,000张无标注RGB-D图像进行预训练,该方法在平均指标(Ave-Metric)上已超越ImageNet预训练模型,展现出强大的泛化能力。
- CDA模块在多个数据集上平均使F-measure提升2.5%,MAE降低1.8%,证实其在跨模态与跨层级融合中的有效性。
- 两种掩蔽任务——跨模态自编码与深度轮廓估计——共同带来F-measure 7.95%的增益,表明其在表示学习中具有协同效应。
- 当应用于表现最佳的SOD模型时,自监督权重始终优于随机初始化,证明其具备良好的泛化能力。
- 随着预训练数据规模的增加,性能稳步提升,表明该方法具有良好的可扩展性,并有望在更大规模数据集上获得进一步增益。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。