[论文解读] Learning to predict crisp boundaries
本文提出了一种新颖的损失函数以及一种端到端的全卷积神经网络,采用自底向上/自顶向下的架构,直接从深层特征预测清晰、单像素宽的边界,无需后处理。该方法在BSDS500(ODS F-score: 0.815)和NYU Depth(ODS F-score: 0.762)上实现了最先进性能,通过解决边界检测训练数据中的类别不平衡问题,显著提升了边界锐度与准确性。
Recent methods for boundary or edge detection built on Deep Convolutional Neural Networks (CNNs) typically suffer from the issue of predicted edges being thick and need post-processing to obtain crisp boundaries. Highly imbalanced categories of boundary versus background in training data is one of main reasons for the above problem. In this work, the aim is to make CNNs produce sharp boundaries without post-processing. We introduce a novel loss for boundary detection, which is very effective for classifying imbalanced data and allows CNNs to produce crisp boundaries. Moreover, we propose an end-to-end network which adopts the bottom-up/top-down architecture to tackle the task. The proposed network effectively leverages hierarchical features and produces pixel-accurate boundary mask, which is critical to reconstruct the edge map. Our experiments illustrate that directly making crisp prediction not only promotes the visual results of CNNs, but also achieves better results against the state-of-the-art on the BSDS500 dataset (ODS F-score of .815) and the NYU Depth dataset (ODS F-score of .762).
研究动机与目标
- 为解决基于CNN的边缘检测中预测边界仍显厚重模糊的问题,即使经过后处理亦无法完全解决。
- 通过在训练过程中直接学习预测锐利、单像素宽的边界,消除边缘细化后处理的需要。
- 通过有效处理边界像素与背景像素之间的严重类别不平衡问题,提升边界检测基准上的性能。
- 开发一种快速、准确且端到端的网络,利用层次化特征生成像素级精确的边界掩码。
提出的方法
- 提出一种专为处理类别不平衡数据而设计的新颖损失函数,其中正样本(边界)与负样本(背景)数量严重失衡。
- 采用具有自底向上/自顶向下架构的全卷积神经网络,有效利用多尺度层次化特征进行边界预测。
- 使用跳跃连接融合不同层级的特征,提升空间精度,实现像素级精确的边界检测。
- 使用所提出的损失函数进行端到端训练,直接优化清晰边界预测,无需后处理。
- 引入一种简单但有效的训练策略,提升泛化能力与边界锐度。
- 在RGB与HHA特征(使用深度信息)上评估模型,通过平均融合预测结果以提升性能。
实验结果
研究问题
- RQ1为何基于CNN的边缘检测器会产生厚重模糊的边界,而非清晰的单像素轮廓?
- RQ2仅通过精心设计的损失函数是否足以提升边界锐度并消除后处理的需要?
- RQ3在视觉质量与F-score等定量指标方面,所提方法与最先进边缘检测器相比表现如何?
- RQ4该方法在保持高精度的前提下,能在多大程度上实现实时推理?
- RQ5该方法是否能在不增加网络架构复杂度的前提下,良好泛化至BSDS500与NYU Depth等数据集?
主要发现
- 所提方法在BSDS500数据集上实现了最先进水平的ODS F-score(0.815),优于先前方法。
- 在NYU Depth数据集上,该方法实现了0.762的ODS F-score,创下新的SOTA基准。
- 模型在GTX 980 GPU上运行速度达30 FPS,展现出实时推理能力。
- 即使不进行后处理,该方法的非NMS性能(ODS F-score: 0.693)也优于CED(ODS F-score: 0.655)在相同条件下的表现。
- 所提损失函数的使用显著提升了边界锐度,通过与HED和RCF的定性对比可直观验证。
- 该方法仅使用RGB数据即可实现优异性能,结合HHA特征后进一步提升,在NYU Depth数据集上达到0.762的ODS F-score。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。