[论文解读] PASCAL Boundaries: A Class-Agnostic Semantic Boundary Dataset
本文提出了 PASCAL Boundaries 数据集,这是一个大规模、与类别无关的语义边界数据集,包含约 10,000 幅图像和 459 个语义类别,旨在解决传统边缘检测中的模糊性问题。本文提出了一种多尺度深度神经网络 M-DSBD,在新数据集上实现了 0.652 的 F-measure,优于基线模型,并在 BSDS500 上展现出强大的可迁移性。
In this paper, we address the boundary detection task motivated by the ambiguities in current definition of edge detection. To this end, we generate a large database consisting of more than 10k images (which is 20x bigger than existing edge detection databases) along with ground truth boundaries between 459 semantic classes including both foreground objects and different types of background, and call it the PASCAL Boundaries dataset, which will be released to the community. In addition, we propose a novel deep network-based multi-scale semantic boundary detector and name it Multi-scale Deep Semantic Boundary Detector (M-DSBD). We provide baselines using models that were trained on edge detection and show that they transfer reasonably to the task of boundary detection. Finally, we point to various important research problems that this dataset can be used for.
研究动机与目标
- 通过定义一个精确的、与类别无关的边界检测任务,专注于语义实例级边界,解决传统边缘检测中的模糊性问题。
- 构建一个大规模、高质量的数据集,包含 10,000 幅图像和 459 个语义类别,以支持边界检测研究。
- 开发一种新颖的深度学习架构 M-DSBD,用于多尺度语义边界检测,以超越现有边缘检测模型的性能。
- 使用在 BSDS500 上预训练的模型提供强基线,以实现公平比较,并证明在新数据集上的可迁移性。
- 推动语义分割与边界检测联合学习、目标提议生成以及遮挡推理等新研究方向。
提出的方法
- 在 PASCAL VOC2010 的 10,000 幅图像中,对 459 个语义类别(前景物体和背景类型)之间的边界进行标注,仅关注物体轮廓,而非内部边缘或纹理边缘。
- 提出一种多尺度深度语义边界检测器(M-DSBD),在多个尺度(1、0.8、0.5)上处理特征图,并使用可学习权重融合预测结果。
- 使用边界检测损失函数(公式 7)进行模型训练,该函数从原始图像尺寸反向传播梯度,以改善特征学习。
- 从网络多个层级引入辅助输出监督,但将其视为特征提取器而非独立检测器,以提升融合性能。
- 以端到端方式训练 M-DSBD 模型,输入为多尺度图像,仅在最终训练阶段更新特定尺度的辅助输出和融合权重,冻结主干网络。
- 使用标准指标比较性能:ODS(最优阈值 F-measure)、OIS(最优交并比 F-measure)和 AP(平均精度)。
实验结果
研究问题
- RQ1与传统边缘检测数据集相比,大规模、与类别无关的语义边界数据集是否能减少边缘检测中的模糊性?
- RQ2与单尺度模型相比,多尺度特征融合在边界检测性能上有哪些提升?
- RQ3在边缘检测数据集(如 BSDS500)上训练的模型,能在多大程度上泛化到具有不同标注语义的新边界检测任务?
- RQ4与最先进的边缘检测器(如 HED、SE)相比,所提出的 M-DSBD 模型在新的、更大且更一致的边界检测基准上表现如何?
- RQ5使用语义边界对下游任务(如目标提议生成和遮挡推理)有何影响?
主要发现
- PASCAL Boundaries 数据集包含 10,000 幅图像和 459 个语义类别,规模是 BSDS500 的 20 倍,且消除了多粒度边缘的模糊性。
- 所提出的 M-DSBD 模型在 PASCAL Boundaries 数据集上实现了 0.652 的 F-measure,优于单尺度 DSBD(0.643)和所有基线边缘检测器。
- 通过多尺度特征融合,M-DSBD 模型相比单尺度版本性能提升 1%,证实了感知尺度边界检测的优势。
- M-DSBD 模型在 BSDS500 上泛化良好,实现了 0.751 的 ODS F-measure,优于 SE(0.746)和 HED(0.782)在该数据集上的表现,即使是在 PASCAL Boundaries 上训练的。
- 定性结果表明,M-DSBD 能以高置信度检测出语义实例边界,有效抑制内部边缘,而传统边缘检测器则无法做到这一点。
- 该模型展现出强大的可迁移性,表明从语义边界中学习能提升模型在边缘检测任务上的泛化能力,即使源数据集与目标数据集的标注风格不同。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。