[论文解读] Exploring Context with Deep Structured models for Semantic Segmentation
本文提出了一种深度结构化模型,将卷积神经网络(CNNs)与条件随机场(CRFs)相结合,通过显式建模补丁-补丁和补丁-背景的上下文关系来提升语义分割性能。通过学习基于CNN的成对势函数以表征图像区域之间的语义兼容性,并采用分段式CRF训练方法,该方法在八个基准数据集上实现了最先进性能,包括PASCAL VOC 2012和COCO。
State-of-the-art semantic image segmentation methods are mostly based on training deep convolutional neural networks (CNNs). In this work, we proffer to improve semantic segmentation with the use of contextual information. In particular, we explore `patch-patch' context and `patch-background' context in deep CNNs. We formulate deep structured models by combining CNNs and Conditional Random Fields (CRFs) for learning the patch-patch context between image regions. Specifically, we formulate CNN-based pairwise potential functions to capture semantic correlations between neighboring patches. Efficient piecewise training of the proposed deep structured model is then applied in order to avoid repeated expensive CRF inference during the course of back propagation. For capturing the patch-background context, we show that a network design with traditional multi-scale image inputs and sliding pyramid pooling is very effective for improving performance. We perform comprehensive evaluation of the proposed method. We achieve new state-of-the-art performance on a number of challenging semantic segmentation datasets including $NYUDv2$, $PASCAL$-$VOC2012$, $Cityscapes$, $PASCAL$-$Context$, $SUN$-$RGBD$, $SIFT$-$flow$, and $KITTI$ datasets. Particularly, we report an intersection-over-union score of $77.8$ on the $PASCAL$-$VOC2012$ dataset.
研究动机与目标
- 通过显式建模超越局部平滑性的复杂空间上下文,提升语义分割性能。
- 解决在端到端训练过程中CRF推理计算成本过高的挑战。
- 通过多尺度特征和滑动金字塔池化提升背景上下文建模能力。
- 开发一种高效训练策略,避免在反向传播过程中重复进行CRF推理。
- 在无需依赖深度数据的某些情况下,于多样且具有挑战性的语义分割基准上实现最先进性能。
提出的方法
- 构建基于CNN的成对势函数,以建模相邻图像补丁之间的语义兼容性,替代传统的Potts模型势函数。
- 引入非对称成对势函数,以捕捉图像区域之间的非对称语义关系。
- 采用CRF的分段式训练方法,避免反向传播过程中的高成本推理,从而实现与深度结构化模型的端到端学习。
- 使用多尺度CNN输入和特征图上的滑动金字塔池化,有效编码补丁-背景上下文。
- 采用粗到细的预测策略:先生成低分辨率的CRF推理分割结果,再通过上采样和后处理阶段进行细化。
- 在训练过程中采用异步梯度更新,以提升优化效率。
实验结果
研究问题
- RQ1基于CNN的、非Potts模型的成对势函数是否能在标准CRF平滑之外进一步提升语义分割性能?
- RQ2CRF的分段式训练在实现与深度结构化模型的端到端学习方面有多高效?
- RQ3引入多尺度和金字塔池化特征在多大程度上提升了背景上下文建模能力?
- RQ4显式建模补丁-补丁和补丁-背景上下文是否能在多样化的数据集上带来一致的性能提升?
- RQ5与依赖深度信息或多任务学习的最先进方法相比,该方法表现如何?
主要发现
- 在PASCAL VOC 2012数据集上,该方法达到83.4%的平均IoU,优于先前方法,实现最先进性能。
- 在COCO数据集(80类)上,该方法实现88.3%的像素准确率、58.7%的平均准确率和46.8%的IoU,显著优于基线全卷积网络。
- 在SUN-RGBD数据集(37类)上,该方法实现78.4%的像素准确率和53.4%的平均准确率,即使在无深度监督的情况下也超越了先前方法。
- 在KITTI数据集(10类)上,该方法实现93.3%的像素准确率和74.5%的平均准确率,通过COCO预训练进一步提升至94.3%和75.9%。
- 在SIFT-flow数据集(33类)上,该方法实现88.1%的像素准确率和53.4%的平均准确率,为该基准上报告的最佳结果。
- 在NYUDv2、Cityscapes和PASCAL-Context数据集上,该方法显著优于现有方法,展示了在多样化场景类别和图像领域中的持续性能提升。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。