[论文解读] Weakly-Supervised Salient Object Detection via Scribble Annotations
本文提出一种弱监督显著性目标检测方法,通过稀疏涂鸦标注而非密集像素级标签进行训练。通过引入辅助边缘检测网络和门控结构感知损失以改善边界定位,并设计涂鸦增强方案以提升标注密度,该方法在六个基准测试上达到与全监督最先进模型相当的性能,显著优于现有弱监督方法。
Compared with laborious pixel-wise dense labeling, it is much easier to label data by scribbles, which only costs 1$\sim$2 seconds to label one image. However, using scribble labels to learn salient object detection has not been explored. In this paper, we propose a weakly-supervised salient object detection model to learn saliency from such annotations. In doing so, we first relabel an existing large-scale salient object detection dataset with scribbles, namely S-DUTS dataset. Since object structure and detail information is not identified by scribbles, directly training with scribble labels will lead to saliency maps of poor boundary localization. To mitigate this problem, we propose an auxiliary edge detection task to localize object edges explicitly, and a gated structure-aware loss to place constraints on the scope of structure to be recovered. Moreover, we design a scribble boosting scheme to iteratively consolidate our scribble annotations, which are then employed as supervision to learn high-quality saliency maps. As existing saliency evaluation metrics neglect to measure structure alignment of the predictions, the saliency map ranking metric may not comply with human perception. We present a new metric, termed saliency structure measure, to measure the structure alignment of the predicted saliency maps, which is more consistent with human perception. Extensive experiments on six benchmark datasets demonstrate that our method not only outperforms existing weakly-supervised/unsupervised methods, but also is on par with several fully-supervised state-of-the-art models. Our code and data is publicly available at https://github.com/JingZhang617/Scribble_Saliency.
研究动机与目标
- 通过使用稀疏涂鸦标注而非密集像素级标注,减少显著性目标检测中的标注负担。
- 通过显式边缘监督和结构感知约束,解决稀疏涂鸦导致的边界定位不佳问题。
- 开发一种涂鸦增强机制,通过迭代优化提升标注密度与质量,以实现更优的模型监督。
- 提出一种新的评估指标——显著性结构度量($B_{\mu}$),通过衡量预测显著性图中的结构对齐性,更好地契合人类感知。
- 证明基于涂鸦的弱监督学习可实现与全监督最先进模型相当的性能。
提出的方法
- 将 DUTS 数据集重新标注为新的基于涂鸦的数据集 S-DUTS,采用稀疏涂鸦(平均覆盖 3% 像素),以支持基于涂鸦的显著性目标检测评估。
- 引入辅助边缘检测网络(EDN),利用 RCF 或 Sobel 边缘图作为监督信号,引导模型学习精确的物体边界。
- 提出一种门控结构感知损失,约束预测的显著性图在显著区域与图像边缘对齐,同时抑制背景结构。
- 设计一种涂鸦增强方案,通过将高置信度预测结果传播至原始涂鸦标注,实现迭代优化下的更密集伪标签生成。
- 采用多分支网络架构,主干分支负责显著性预测,辅助分支执行边缘检测,两者联合训练并分别使用对应损失函数。
- 结合交叉熵损失用于显著性预测与边缘检测,以及门控结构感知损失,联合优化模型的准确性和结构保真度。
实验结果
研究问题
- RQ1仅使用稀疏涂鸦标注是否能有效训练显著性目标检测模型,其成本远低于像素级标注?
- RQ2当训练数据仅为缺乏结构细节的稀疏涂鸦时,如何改善物体边界定位?
- RQ3引入辅助边缘检测任务是否能提升预测显著性图的结构保真度?
- RQ4涂鸦增强机制是否能通过迭代方式提升标注质量并带来更好的模型性能?
- RQ5所提出的显著性结构度量($B_{\mu}$)是否比传统指标(如 MAE)更符合人类感知?
主要发现
- 所提方法在六个基准数据集(包括 DUT-OSR、DUTS-TE、ECSSD、PASCAL-S、HKU-IS 和 DIB-R)上均优于所有现有弱监督与无监督显著性目标检测方法。
- 该方法性能与多个全监督最先进模型相当,证明基于涂鸦的弱监督学习可媲美全监督学习。
- 门控结构感知损失显著改善边界定位,相比标准平滑损失,使 $B_{\mu}$ 指标降低 0.025,表明结构对齐性更优。
- 涂鸦增强方案相比基线模型使 $B_{\mu}$ 提升 0.011,证明其在优化稀疏标注方面的有效性。
- 与不使用辅助边缘检测任务相比,引入该任务使 $B_{\mu}$ 降低 0.038,证实其在提升结构准确性方面的重要作用。
- 模型对标注差异具有鲁棒性,在多位标注者提供的不同稀疏涂鸦标注下均保持一致性能,表明其在标注稀疏与重叠程度不一的情况下仍具可靠性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。