[论文解读] Richer and Deeper Supervision Network for Salient Object Detection
本文提出了一种用于显著性目标检测的更丰富、更深层监督(RDS)网络,通过利用更丰富的全局和局部表征来增强多尺度输出之间的特征融合。通过在目标检测数据集(ImageNet-DET 和 PASCAL-VOC)上进行预训练以注入粗粒度全局上下文,RDS 在五个基准数据集上实现了最先进性能,F-measure 分数最高达 0.953,MAE 低至 0.028。
Recent Salient Object Detection (SOD) systems are mostly based on Convolutional Neural Networks (CNNs). Specifically, Deeply Supervised Saliency (DSS) system has shown it is very useful to add short connections to the network and supervising on the side output. In this work, we propose a new SOD system which aims at designing a more efficient and effective way to pass back global information. Richer and Deeper Supervision (RDS) is applied to better combine features from each side output without demanding much extra computational space. Meanwhile, the backbone network used for SOD is normally pre-trained on the object classification dataset, ImageNet. But the pre-trained model has been trained on cropped images in order to only focus on distinguishing features within the region of the object. But the ignored background information is also significant in the task of SOD. We try to solve this problem by introducing the training data designed for object detection. A coarse global information is learned based on an entire image with its bounding box before training on the SOD dataset. The large-scale of object images can slightly improve the performance of SOD. Our experiment shows the proposed RDS network achieves the state-of-the-art results on five public SOD datasets.
研究动机与目标
- 解决现有深度监督网络在显著性目标检测中浅层全局特征传播的局限性。
- 在不显著增加计算成本的前提下,提升多尺度侧输出之间特征融合的效率。
- 通过利用大规模目标检测数据集进行预训练,缓解显著性检测中的数据稀缺问题。
- 通过引入来自目标检测标注的背景感知特征,提升性能,这些特征比 ImageNet 分类数据更具信息量。
- 探究在目标检测数据上进行预训练与在 ImageNet 分类数据上进行预训练对显著性检测的影响差异。
提出的方法
- 提出一种新颖的 RDS 网络架构,通过使用更丰富、更深层的监督路径,在侧输出之间增强特征融合,以改善全局与局部特征的整合。
- 引入两阶段训练策略:首先在合并的目标检测数据集(ImageNet-DET + PASCAL-VOC)上进行微调,以学习粗粒度位置上下文;然后在 SOD 数据集上进行微调。
- 采用残差网络(ResNet-152)作为主干网络,在多个层级设置侧输出,以实现深度监督和多层级特征聚合。
- 在预训练过程中利用目标检测数据集的边界框标注,注入上下文和背景感知特征,提升泛化能力。
- 在侧输出上应用交叉熵损失和 L1 损失进行监督,重点关注保留高层语义信息和低层边缘细节。
- 采用两阶段微调过程以缓解灾难性遗忘,先在目标检测数据上以较低的初始起始学习率(0.001)进行微调,再进行 SOD 微调。
实验结果
研究问题
- RQ1更丰富、更深层的监督机制是否能在不增加计算成本的前提下,改善显著性检测网络中的特征融合?
- RQ2与在 ImageNet 分类数据上预训练相比,在包含完整图像上下文的目标检测数据集上进行预训练是否能提升显著性检测性能?
- RQ3从边界框标注中引入的背景和目标上下文信息,对显著性目标检测有何影响?
- RQ4在使用多阶段预训练时,灾难性遗忘对从目标检测到显著性检测的知识迁移影响有多大?
- RQ5所提出的 RDS 网络是否能在多样化的公开 SOD 基准数据集中超越现有最先进方法?
主要发现
- RDS-152 模型在 HKU-IS 数据集上取得了最高的 F-measure(0.953),优于所有其他最先进方法。
- 在 DUT-OMRON 数据集上,RDS-152 实现了最佳 F-measure(0.837)和最低 MAE(0.050),在所有对比方法中排名第一。
- RDS-152-OBJ 变体在 PASCAL-SOD 子集上取得了 0.818 的 F-measure,优于其他方法(包括 AMU 和 SRM)。
- PR 曲线分析表明,RDS-152-OBJ 在所有五个公开 SOD 数据集中均持续优于竞争对手,尤其在高召回率区域表现更优。
- 消融研究显示,基于目标检测数据的预训练带来了轻微但稳定的性能提升,尤其在边界精度和全局上下文理解方面。
- 尽管目标检测预训练带来了轻微改进,但模型仍受到灾难性遗忘的影响,表明未来工作需采用更优的持续学习策略。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。