Skip to main content
QUICK REVIEW

[论文解读] Improving Fully Convolution Network for Semantic Segmentation

Bing Shuai, Ting Liu|arXiv (Cornell University)|Nov 28, 2016
Advanced Neural Network Applications参考文献 30被引用 21
一句话总结

该论文提出改进的全卷积网络(IFCN),通过引入具有密集跳跃连接的上下文网络,扩展感受野并融合多尺度上下文特征,从而提升语义分割性能。IFCN在ADE20K、Pascal Context、Pascal VOC 2012和SUN-RGBD数据集上均取得了最先进性能,无需后处理或COCO预训练,在所有基准测试中比FCN的mIOU提升超过7.5%。

ABSTRACT

Fully Convolution Networks (FCN) have achieved great success in dense prediction tasks including semantic segmentation. In this paper, we start from discussing FCN by understanding its architecture limitations in building a strong segmentation network. Next, we present our Improved Fully Convolution Network (IFCN). In contrast to FCN, IFCN introduces a context network that progressively expands the receptive fields of feature maps. In addition, dense skip connections are added so that the context network can be effectively optimized. More importantly, these dense skip connections enable IFCN to fuse rich-scale context to make reliable predictions. Empirically, those architecture modifications are proven to be significant to enhance the segmentation performance. Without engaging any contextual post-processing, IFCN significantly advances the state-of-the-arts on ADE20K (ImageNet scene parsing), Pascal Context, Pascal VOC 2012 and SUN-RGBD segmentation datasets.

研究动机与目标

  • 解决标准全卷积网络(FCN)在处理高分辨率输入和上下文感知能力有限方面的局限性。
  • 缩小ImageNet分类预训练与高分辨率分割任务之间的领域差距。
  • 通过实现更丰富的多尺度上下文聚合和更大的有效感受野,提升语义分割性能。
  • 开发一种即插即用的架构,在不引入新计算层或额外预训练数据的前提下增强FCN。

提出的方法

  • 提出一种上下文网络,由堆叠的卷积模块组成,通过密集跳跃连接逐步扩展特征图的感受野。
  • 利用所有中间特征图的密集跳跃连接,促进误差反向传播,实现对上下文网络的有效优化。
  • 从预训练VGG-16网络的早期层引入跳跃连接,融合多尺度特征,提升定位精度。
  • 移除最后两个全连接层(fc6, fc7),以减小网络规模并提升特征图紧凑性。
  • 采用改进的网络结构,将上下文网络插入预训练CNN与上采样层之间,实现端到端的分割数据微调。
  • 利用标准深度学习框架实现,确保兼容性与部署便捷性。

实验结果

研究问题

  • RQ1如何有效扩展FCN特征图的感受野,以提升语义分割中的上下文理解能力?
  • RQ2在上下文网络中使用密集跳跃连接是否能改善高分辨率分割任务中的优化与特征融合?
  • RQ3从浅层和深层特征中进行多尺度上下文聚合,在多样化数据集上能多大程度提升分割精度?
  • RQ4在不使用COCO等辅助数据集进行预训练的情况下,改进的FCN架构能否实现最先进性能?
  • RQ5与DeepLab和DilatedNet等现有最先进模型相比,所提出的IFCN架构在推理效率和精度方面表现如何?

主要发现

  • IFCN-8s在Pascal VOC 2012上达到79.3%的平均交并比(mIOU),显著优于FCN-8s(37.8%),并超越先前最先进方法如DeepLab-v2和DilatedNet。
  • 在ADE20K上,IFCN-8s达到75.3% mIOU,优于FCN-8s及其他领先方法如CRF-RNN和UoA-Context。
  • 在Pascal Context上,IFCN-8s达到75.3% mIOU,展现出对FCN-8s和最先进模型如LRR与DPN的一致性改进。
  • 在SUN-RGBD上,IFCN-8s达到45.0% mIOU,表现出对室内和室外场景的强泛化能力。
  • IFCN-8s采用ResNet-101主干网络时,在Pascal Context上达到49.9% mIOU,进一步推进了最先进水平,且无需COCO预训练。
  • IFCN-8s(VGG-16主干)的推理时间为每张图像47.9ms,考虑到其性能提升,该速度合理且与现代深度学习框架兼容。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。