[论文解读] Self-Supervised Representation Learning for RGB-D Salient Object Detection.
本文提出了一种用于RGB-D显著性目标检测的自监督表示学习框架,通过在未标注的RGB-D数据上进行两个掩码任务——跨模态自编码器和深度轮廓估计——进行预训练,即使仅使用6,392张未标注图像,性能也与ImageNet预训练模型相当。
Existing CNNs-Based RGB-D Salient Object Detection (SOD) networks are all required to be pre-trained on the ImageNet to learn the hierarchy features which can help to provide a good initialization. However, the collection and annotation of large-scale datasets are time-consuming and expensive. In this paper, we utilize Self-Supervised Representation Learning (SSL) to design two pretext tasks: the cross-modal auto-encoder and the depth-contour estimation. Our pretext tasks require only a few and unlabeled RGB-D datasets to perform pre-training, which makes the network capture rich semantic contexts and reduce the gap between two modalities, thereby providing an effective initialization for the downstream task. In addition, for the inherent problem of cross-modal fusion in RGB-D SOD, we propose a consistency-difference aggregation (CDA) module that splits a single feature fusion into multi-path fusion to achieve an adequate perception of consistent and differential information. The CDA module is general and suitable for both cross-modal and cross-level feature fusion. Extensive experiments on six benchmark RGB-D SOD datasets, our model pre-trained on the RGB-D dataset ($6,392$ without any annotations) can perform favorably against most state-of-the-art RGB-D methods pre-trained on ImageNet ($1,280,000$ with image-level annotations).
研究动机与目标
- 解决大规模标注数据集在RGB-D显著性目标检测预训练中的高成本与高投入问题。
- 通过在未标注的RGB-D数据上利用自监督学习,减少对ImageNet预训练的依赖。
- 通过掩码任务提升RGB-D融合中的跨模态特征对齐与语义理解。
- 通过设计通用的融合模块,克服RGB-D SOD中固有的跨模态融合挑战。
- 通过在小规模未标注RGB-D数据集上预训练,实现在极小监督下的最先进性能。
提出的方法
- 设计一种跨模态自编码器掩码任务,从共享潜在表示中重建RGB和深度模态的特征,以促进模态对齐。
- 引入一种深度轮廓估计掩码任务,从RGB特征预测深度边缘图,以增强几何与结构理解。
- 提出一种一致性-差异性聚合(CDA)模块,将特征融合分解为一致性和差异性路径,以提升跨模态与跨层级的特征交互。
- 在包含6,392张图像的小规模未标注RGB-D数据集上,使用两个掩码任务端到端训练网络,以学习丰富的层次化表示。
- 在下游RGB-D SOD任务上,仅使用边界框或分割标注对预训练模型进行微调。
- 将CDA模块应用于跨模态与跨层级的特征融合,实现对模态与特征层级间共享与独特信息的有效感知。
实验结果
研究问题
- RQ1在未标注的RGB-D数据上使用自监督掩码任务,能否有效替代ImageNet预训练用于RGB-D显著性目标检测?
- RQ2跨模态自编码器与深度轮廓估计掩码任务在多大程度上能捕捉RGB-D数据中的语义与结构信息?
- RQ3一致性-差异性聚合(CDA)模块在多大程度上提升了RGB-D SOD中的跨模态特征融合?
- RQ4在仅使用6,392张未标注RGB-D图像进行预训练的模型,能否在基准数据集上达到与ImageNet预训练模型相当的性能?
- RQ5CDA模块在不同融合场景(如跨模态与跨层级特征融合)中具有多强的泛化能力?
主要发现
- 在6,392张未标注RGB-D图像上进行的自监督预训练,性能可与在1,280,000张图像级标注的ImageNet上预训练的最先进方法相媲美。
- 跨模态自编码器与深度轮廓估计掩码任务显著提升了特征表示质量与模态对齐能力。
- 一致性-差异性聚合(CDA)模块通过显式建模模态与特征层级间的一致性与差异性信息,增强了特征融合效果。
- 该模型在六个基准数据集上均优于或匹配大多数现有RGB-D SOD方法,即使在预训练阶段完全无图像级标注。
- 消融实验证实,两个掩码任务均对性能提升有贡献,其中深度轮廓估计在边缘与轮廓理解方面尤为有效。
- CDA模块在跨模态与跨层级融合中均表现出良好的泛化能力,一致提升了准确率与鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。