Skip to main content
QUICK REVIEW

[论文解读] Improving Semantic Segmentation via Decoupled Body and Edge Supervision

Xiangtai Li, Xia Li|arXiv (Cornell University)|Jul 20, 2020
Advanced Neural Network Applications参考文献 67被引用 19
一句话总结

本文提出了一种用于语义分割的新型解耦式体部与边缘监督框架,通过分别优化高频边缘特征与低频体部特征,提升了对象的一致性与边界精度。通过使用可学习的光流场对特征进行变形以增强体部一致性,并对边缘与体部组件施加独立监督,该方法在仅使用精细标注数据的情况下实现了最先进性能,在Cityscapes数据集上达到83.7%的mIoU。

ABSTRACT

Existing semantic segmentation approaches either aim to improve the object's inner consistency by modeling the global context, or refine objects detail along their boundaries by multi-scale feature fusion. In this paper, a new paradigm for semantic segmentation is proposed. Our insight is that appealing performance of semantic segmentation requires extit{explicitly} modeling the object extit{body} and extit{edge}, which correspond to the high and low frequency of the image. To do so, we first warp the image feature by learning a flow field to make the object part more consistent. The resulting body feature and the residual edge feature are further optimized under decoupled supervision by explicitly sampling different parts (body or edge) pixels. We show that the proposed framework with various baselines or backbone networks leads to better object inner consistency and object boundaries. Extensive experiments on four major road scene semantic segmentation benchmarks including extit{Cityscapes}, extit{CamVid}, extit{KIITI} and extit{BDD} show that our proposed approach establishes new state of the art while retaining high efficiency in inference. In particular, we achieve 83.7 mIoU \% on Cityscape with only fine-annotated data. Code and models are made available to foster any further research (\url{https://github.com/lxtGH/DecoupleSegNets}).

研究动机与目标

  • 为解决语义分割模型在保持对象内部一致性与保留精细边界细节方面的局限性。
  • 通过统一的解耦框架显式建模分割特征的高频(边缘)与低频(体部)分量。
  • 通过联合优化体部与边缘特征并施加任务特定监督,提升在道路场景基准上的性能。
  • 在不牺牲推理效率的前提下实现最先进结果,尤其适用于仅提供精细标注数据的场景。

提出的方法

  • 使用可学习的光流场对特征图进行变形,将像素向对象中心对齐,以增强体部一致性。
  • 通过使用学习到的光流场对输入特征图进行变形,提取体部特征,生成平滑且一致的表示。
  • 通过从原始特征图中减去体部特征获得边缘特征,以保留高频细节。
  • 体部特征使用标准交叉熵损失进行监督,掩码排除边缘区域;边缘特征则使用独立的边缘掩码进行监督。
  • 将优化后的体部与边缘特征融合为重构特征图,再通过标准交叉熵损失进行监督。
  • 在训练过程中应用边界松弛策略,以提升体部与边缘预测之间的互补性。

实验结果

研究问题

  • RQ1将语义特征学习解耦为体部与边缘分量是否能提升分割性能?
  • RQ2对高频与低频分量的显式监督是否能带来更好的对象一致性和边界精度?
  • RQ3基于光流的变形机制是否能有效增强特征空间中对象体部的一致性?
  • RQ4与端到端训练相比,解耦监督在mIoU与推理效率方面表现如何?
  • RQ5所提方法是否能在仅使用精细标注数据的情况下实现最先进性能,从而避免对粗标注数据的依赖?

主要发现

  • 所提方法在仅使用精细标注数据的情况下,于Cityscapes测试集上实现了83.7%的mIoU,创下新的最先进纪录。
  • 在Cityscapes数据集中,该方法在19个类别中的18个上优于现有方法,尤其在小物体类别(如“pole”和“traffic light”)上取得显著提升。
  • 在仅使用精细标注的情况下,该模型在Cityscapes测试集上达到82.8%的mIoU,超越了此前的SOTA方法(如G-SCNN与AutoDeepLab-L)。
  • 可视化结果表明,该方法有效减少了大对象内部的模糊现象,并恢复了小对象中缺失的边界细节,尤其在Deeplabv3+模型上表现显著。
  • 光流场可视化证实,模型学习到了有意义的空间变换,能够将对象区域内的像素对齐,从而提升特征的一致性。
  • 消融实验表明,解耦监督在多种主干网络与基线模型上均带来一致的性能提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。